推理服务是怎么影响你的 Agent 的:推理框架与架构决策

自顶向下拆解推理框架:延迟构成、上下文成本、模型路由、多模态代价、韧性设计——面向 Agent 架构师的推理层指南。

2026年2月27日 · 28 分钟 · Cui Liang

一句话是怎么变成 AI 回复的:LLM 的工作原理

从 Tokenization 到自回归生成,用一句「帮我查一下北京明天的天气」走完 LLM 处理全流程。面向 Agent 开发者的灰盒认知指南。

2026年2月15日 · 39 分钟 · Cui Liang

Prompt Cache:Agent 成本控制的核心约束

从 KV Cache 到 Prompt Cache 的认知跃迁:前缀精确匹配的铁律、Agent 的 I/O 100:1 失衡、以及为什么 Cache-Safe 是 Client 侧工程责任。

2026年1月17日 · 8 分钟 · Cui Liang

KV Cache 原理:LLM 推理的底层机制

从 Token、Embedding、Attention 到 Prefill/Decode,一次讲透 KV Cache 的底层原理。面向 Agent 工程师的推理基础指南。

2026年1月10日 · 25 分钟 · Cui Liang