Part II 模型与推理层¶
Part II 关注模型进入企业平台后的完整决策链:不是单独讨论“哪个模型更强”,而是从模型选择、服务化、性能优化、输出契约一直走到能力定制与知识增强。 五章共同回答一个问题:如何让模型能力在质量、成本、延迟、数据边界和可运维性之间形成可持续的生产体系。
本部分章节¶
| 章节 | 核心问题 | 阅读重点 |
|---|---|---|
| 第5章 大模型选型 | 如何从任务画像建立可评测、可路由、可回退的模型矩阵 | 任务画像、运行时路由、生命周期、质量-成本-延迟取舍 |
| 第6章 本地推理引擎 | 如何把开放权重模型变成可运营的企业推理服务 | TTFT/TPOT、Prefill/Decode、部署形态、引擎选型、故障诊断 |
| 第7章 推理优化 | 如何先定位瓶颈,再选择 KV Cache、Prefix Cache、量化或推测解码 | KV Cache、Prefix Cache、Speculative Decoding、量化、任务级优化策略 |
| 第8章 结构化输出与提示工程 | 如何让模型输出成为可验证、可恢复、可演进的接口契约 | Prompt/schema/工具三类契约、解析校验、幂等、Schema 演进 |
| 第9章 模型能力定制与知识增强 | 何时应该改 Prompt、接 RAG、做微调或对齐 | 失败样本分诊、LoRA/RAG/对齐边界、发布闭环、定制资产治理 |
建议阅读路径¶
如果负责模型平台或基础设施,建议按 第5章 → 第6章 → 第7章 建立“选型—服务—优化”主线;如果负责 Agent 应用开发,可重点阅读 第5章 → 第8章 → 第9章,理解模型路由、结构化接口和能力定制;负责平台治理时,则应关注各章共同强调的版本、评测、灰度、回退和 Trace 证据。
Part II 的关键判断可以概括为:模型能力不是一个静态依赖,而是一组需要被评测、路由、约束、优化和持续更新的平台资源。