标签:llm-inference
-
大语言模型推理技术工作坊:从第一性原理到生产级部署与选型
📝
🎙️ AI Engineer
📄 本次工作坊旨在帮助初级和中级工程师深入理解大语言模型推理的底层机制、核心痛点(如成本、显存、延迟)以及模型优化和推理服务架构的优化策略。内容涵盖模型量化、注意力机制演进(MQA/GQA/MLA)、主流推理引擎(vLLM, SGLang, TensorRT-LLM)的选型决策,并探讨了KV Cache管理和分布式推理等进阶方向。 -
Kubernetes 上的 KV Cache 感知路由与 P/D 分离架构深演
📝
🎙️ AI Engineer
📄 本文基于 Red Hat 推理团队专家的分享,深入探讨了 Agent 智能体时代大语言模型(LLM)推理面临的挑战。重点解析了如何通过 LLMD 实现 KV Cache 感知路由和前向填充与解码(P/D)分离架构,并分享了在 H200 芯片集群上部署 GLM 5.2 模型的实战案例与多维性能优化数据。 -
挑战GPU与重塑算力边界:Cerebras晶圆级引擎的十年物理学赌局
📝
🎙️ 硅谷101
📄 本文深度还原了AI芯片先锋Cerebras从2016年成立到2026年成功IPO的十年波折历程。文章详细梳理了Cerebras如何凭借激进的晶圆级集成(Wafer-Scale Engine)设计突破传统GPU的内存带宽瓶颈,在经历早期融资困难、技术攻坚及地缘政治审查后,最终借助AI推理时代的爆发与OpenAI达成200亿美元的史诗级合作,重塑全球AI基础设施的竞争格局。 -
大模型推理加速的系统级工程:DeepSeek V4-Pro DSpark 推测解码方案深度解析与开源工具链 DeepSpec
📝
🎙️ Best Partners TV
📄 本文深度解析了 DeepSeek 为 V4 系列模型推出的 DSpark 推测解码加速方案及开源工具链 DeepSpec。DSpark 通过融合半自回归生成架构、置信度调度验证、在线温度校准以及异步硬件感知调度,成功解决了传统自回归和并行推测解码中延迟、吞吐与后缀衰减的矛盾,在无损输出质量的前提下,实现单用户生成速度提速 60% 至 85%,高并发下吞吐提升数倍,为大模型线上生产部署提供了算法与硬件协同设计的新范式。 -
LLM 推理是怎么跑的:跟着 SGLang Omni
团队的设计思路走一遍
🎙️ yage.ai
📄 SGLang Omni展示了顶级推理系统团队在设计时的完整决策链路。文章通过对语音大模型(Omni模型)的计算特性分析,揭示了多阶段推理(Multi-stage decode)中各环节计算瓶颈和依赖关系的差异。作者强调计算特性是系统设计的核心,主张通过调度解耦、分层通信和动态显存管理等架构选择,解决异构stage间的资源竞争与同步开销,为理解推理系统架构设计提供了范本。 -
深度解码 KV Cache:大模型生成加速的底层逻辑与优化实务
📝
🎙️ Hung-yi Lee
📄 本文深入探讨了大语言模型生成过程中的核心优化技术——KV Cache。从 Prefill 与 Decode 阶段的差异入手,解析了 KV Cache 如何通过存储键值对来消除重复计算。针对显存压力,文章详细对比了 MQA、GQA 及 DeepSeek 首创的 MLA 等架构级优化方案,并介绍了 Streaming LLM 与剪枝等前沿技术。最后,结合 OpenAI 的计费模型,为 AI Agent 的 Prompt 设计提供了极具价值的成本优化建议。