GLM-5.3-Flash 亮相:18B 激活参数背后的 Agent 性价比路线

匿名模型 ox-alpha 正式确认为 GLM-5.3-Flash。320B 总参数、18B 激活参数、原生多模态与百万 Token 上下文背后,是一条针对高频 Agent 工作负载优化的性价比路线。

2026年8月26日 · 7 分钟 · Cui Liang

推理服务是怎么影响你的 Agent 的:推理框架与架构决策

自顶向下拆解推理框架:延迟构成、上下文成本、模型路由、多模态代价、韧性设计——面向 Agent 架构师的推理层指南。

2026年2月27日 · 28 分钟 · Cui Liang

Prompt Cache:Agent 成本控制的核心约束

从 KV Cache 到 Prompt Cache 的认知跃迁:前缀精确匹配的铁律、Agent 的 I/O 100:1 失衡、以及为什么 Cache-Safe 是 Client 侧工程责任。

2026年1月17日 · 8 分钟 · Cui Liang

KV Cache 原理:LLM 推理的底层机制

从 Token、Embedding、Attention 到 Prefill/Decode,一次讲透 KV Cache 的底层原理。面向 Agent 工程师的推理基础指南。

2026年1月10日 · 25 分钟 · Cui Liang