跳转至

Part III 数据基础设施层

Agent 能否进入企业生产,取决于它看到的事实是否及时、可信、可追溯、可解释。Part III 不把数据平台当作 Agent 的后台设施,而是把它视为智能系统的事实底座:数据如何进入、如何形成可回放版本、如何被受控查询、如何实时更新,以及如何通过质量、元数据和指标语义进入 Agent 运行时。

这一部分的核心判断是:模型负责理解和推理,数据基础设施负责证明模型正在基于哪一版事实工作。

本部分章节

章节 核心问题 关键工程判断
第10章 数据采集与集成 源系统数据怎样进入 Agent 平台 采集不只是搬数据,还要暴露来源、位点、新鲜度、质量与恢复语义
第11章 数据湖与湖仓 数据怎样形成可引用、可回放的版本 湖仓的关键是事务、快照和表语义,而不只是对象存储
第12章 湖仓引擎与 OLAP DataAgent 的 SQL 怎样被安全、高效执行 模型提出查询意图,平台负责路由、权限、预算、超时和证据
第13章 流式计算与实时数据 实时数据什么时候真正有价值 只有低延迟会改变业务动作时才值得承担流式状态与恢复复杂度
第14章 数据编排与质量 数据什么时候可以被 Agent 使用 任务成功不等于资产可用,质量门禁必须改变 Agent 的产品行为
第15章 元数据、血缘、契约与指标 Agent 怎样知道数据口径和来源 元数据、血缘、契约和语义层要成为运行时控制面,而不是离线文档

阅读路径

第10章至第13章沿着事实生产链展开:采集 → 版本化存储 → 查询执行 → 实时计算。第14章和第15章则补上可信数据必需的两个控制面:前者解决“这批数据现在能不能用”,后者解决“这批数据到底是什么、应该怎样解释”。

后续 DataAgent 的 Schema Linking、NL2SQL、经营分析、报告生成、Trace 与 Eval,都建立在这套基础之上。没有稳定的数据契约和版本证据,模型层做得越自动,错误事实传播得也越快。