GLM-5.3-Flash 亮相:18B 激活参数背后的 Agent 性价比路线
匿名模型 ox-alpha 正式确认为 GLM-5.3-Flash。320B 总参数、18B 激活参数、原生多模态与百万 Token 上下文背后,是一条针对高频 Agent 工作负载优化的性价比路线。
匿名模型 ox-alpha 正式确认为 GLM-5.3-Flash。320B 总参数、18B 激活参数、原生多模态与百万 Token 上下文背后,是一条针对高频 Agent 工作负载优化的性价比路线。
自顶向下拆解推理框架:延迟构成、上下文成本、模型路由、多模态代价、韧性设计——面向 Agent 架构师的推理层指南。
从 Tokenization 到自回归生成,用一句「帮我查一下北京明天的天气」走完 LLM 处理全流程。面向 Agent 开发者的灰盒认知指南。
从 KV Cache 到 Prompt Cache 的认知跃迁:前缀精确匹配的铁律、Agent 的 I/O 100:1 失衡、以及为什么 Cache-Safe 是 Client 侧工程责任。
从 Token、Embedding、Attention 到 Prefill/Decode,一次讲透 KV Cache 的底层原理。面向 Agent 工程师的推理基础指南。