Part IX 前端、交互与多模态¶
本部分目标¶
Part IX 解决 Agent 平台最后一公里的“可理解、可操作、可恢复”。前端不是模型输出的显示器,而是 Runtime 状态、工具证据、人工决策和现实世界输入的业务界面。
三章形成一条递进链路:第47章先用稳定事件协议把一次 Run 映射成可恢复的对话任务;第48章把 Tool Result 变成图表、表格、表单、Artifact 和审批卡片;第49章再让文件、图片和语音以受控 Evidence 的方式进入同一条任务链。
本部分章节¶
| 章 | 主题 | 核心问题 |
|---|---|---|
| 第47章 对话 UI 与流式输出 | SSE、事件模型、Reducer、恢复 | 用户怎样看懂 Agent 正在做什么,断线后怎样继续 |
| 第48章 Generative UI 与富交互 | Render Contract、组件、Artifact、审批 | 工具结果怎样变成可操作又可审计的业务产物 |
| 第49章 多模态输入与语音 Agent | 文件解析、Context Ref、WebRTC、语音确认 | 现实世界输入怎样安全进入 Agent |
三个贯穿原则¶
状态以 Runtime 为准。 模型文字不能决定工具是否成功、审批是否完成或任务是否取消。
界面动作以服务端授权为准。 前端可以显示按钮和确认卡,但任何写操作、导出或审批都需要重新校验身份与 Policy。
输入和输出都要保留证据引用。 图表需要 data_ref,Artifact 需要 EvidenceRef,上传材料需要 context_ref;浏览器不应成为事实和权限的永久存储。
阅读建议¶
前端工程师建议完整阅读三章,并重点关注事件版本、组件白名单和异常路径。Agent/Runtime 工程师应重点看第47章状态契约和第48章动作回写。DataAgent 与多模态团队需要结合第19章、第36章理解解析、Evidence 与报告之间的关系。安全团队则应关注 XSS、导出重检、敏感文件、语音确认和留存边界。
Part IX 的目标不是做一个更炫的聊天窗口,而是让用户真正能够在 Agent 的运行过程中看见事实、纠正输入、确认动作,并在失败后继续工作。