跳转至

Part IX 前端、交互与多模态

本部分目标

Part IX 解决 Agent 平台最后一公里的“可理解、可操作、可恢复”。前端不是模型输出的显示器,而是 Runtime 状态、工具证据、人工决策和现实世界输入的业务界面。

三章形成一条递进链路:第47章先用稳定事件协议把一次 Run 映射成可恢复的对话任务;第48章把 Tool Result 变成图表、表格、表单、Artifact 和审批卡片;第49章再让文件、图片和语音以受控 Evidence 的方式进入同一条任务链。

本部分章节

主题 核心问题
第47章 对话 UI 与流式输出 SSE、事件模型、Reducer、恢复 用户怎样看懂 Agent 正在做什么,断线后怎样继续
第48章 Generative UI 与富交互 Render Contract、组件、Artifact、审批 工具结果怎样变成可操作又可审计的业务产物
第49章 多模态输入与语音 Agent 文件解析、Context Ref、WebRTC、语音确认 现实世界输入怎样安全进入 Agent

三个贯穿原则

状态以 Runtime 为准。 模型文字不能决定工具是否成功、审批是否完成或任务是否取消。

界面动作以服务端授权为准。 前端可以显示按钮和确认卡,但任何写操作、导出或审批都需要重新校验身份与 Policy。

输入和输出都要保留证据引用。 图表需要 data_ref,Artifact 需要 EvidenceRef,上传材料需要 context_ref;浏览器不应成为事实和权限的永久存储。

阅读建议

前端工程师建议完整阅读三章,并重点关注事件版本、组件白名单和异常路径。Agent/Runtime 工程师应重点看第47章状态契约和第48章动作回写。DataAgent 与多模态团队需要结合第19章、第36章理解解析、Evidence 与报告之间的关系。安全团队则应关注 XSS、导出重检、敏感文件、语音确认和留存边界。

Part IX 的目标不是做一个更炫的聊天窗口,而是让用户真正能够在 Agent 的运行过程中看见事实、纠正输入、确认动作,并在失败后继续工作。