跳转至

Part II 模型与推理层

Part II 关注模型进入企业平台后的完整决策链:不是单独讨论“哪个模型更强”,而是从模型选择、服务化、性能优化、输出契约一直走到能力定制与知识增强。 五章共同回答一个问题:如何让模型能力在质量、成本、延迟、数据边界和可运维性之间形成可持续的生产体系。

本部分章节

章节 核心问题 阅读重点
第5章 大模型选型 如何从任务画像建立可评测、可路由、可回退的模型矩阵 任务画像、运行时路由、生命周期、质量-成本-延迟取舍
第6章 本地推理引擎 如何把开放权重模型变成可运营的企业推理服务 TTFT/TPOT、Prefill/Decode、部署形态、引擎选型、故障诊断
第7章 推理优化 如何先定位瓶颈,再选择 KV Cache、Prefix Cache、量化或推测解码 KV Cache、Prefix Cache、Speculative Decoding、量化、任务级优化策略
第8章 结构化输出与提示工程 如何让模型输出成为可验证、可恢复、可演进的接口契约 Prompt/schema/工具三类契约、解析校验、幂等、Schema 演进
第9章 模型能力定制与知识增强 何时应该改 Prompt、接 RAG、做微调或对齐 失败样本分诊、LoRA/RAG/对齐边界、发布闭环、定制资产治理

建议阅读路径

如果负责模型平台或基础设施,建议按 第5章 → 第6章 → 第7章 建立“选型—服务—优化”主线;如果负责 Agent 应用开发,可重点阅读 第5章 → 第8章 → 第9章,理解模型路由、结构化接口和能力定制;负责平台治理时,则应关注各章共同强调的版本、评测、灰度、回退和 Trace 证据。

Part II 的关键判断可以概括为:模型能力不是一个静态依赖,而是一组需要被评测、路由、约束、优化和持续更新的平台资源。