标签:inference-engine
-
8 路并发每路仍有 141 tok/s:2×5090 跑 27B
小模型,为什么它已经是 sweet spot
🎙️ yage.ai
📄 文章探讨了在本地自托管 27B 小模型时,如何通过优化硬件配置(如 2×5090)和推理引擎(如 SGLang DFlash2)来达到性能甜蜜点(sweet spot)。核心论点在于,自托管的价值不在于单纯的成本节约,而在于对数据合规性、隐私控制和推理栈的完全掌控。文章通过详细的并发压测数据,论证了在特定负载下,消费级硬件可以提供充裕的解码吞吐,并对比了自建与云端租赁的经济决策变量,强调了使用率对成本效益的决定性影响。 -
vLLM 背后的人:一个开源项目如何长成一家公司 · 乔木博客
🎙️ 向阳乔木
📄 本文探讨了开源项目 vLLM 从算法研究转向系统工程的演变过程,以及其背后的商业化逻辑。文章阐述了从算法研究到系统工程的转变,强调系统和数据对模型成败的重要性,并分析了 DeepSeek 等公司在推理引擎优化上的实践,以及开源社区治理的挑战和创业的必要性。 -
前沿人工智能基础设施的构建与开源生态的商业化探索
📝
🎙️ 硅谷101
📄 文章探讨了从学术研究到行业实践的跨越,重点介绍了推理引擎、大模型基础设施(LLM Infra)的发展愿景。核心内容包括对高强度驱动力、形式化验证在AI领域的应用、社区项目孵化以及构建与强力AI共存未来的哲学思考。 -
“榨”出硅的极限:AI Infra的效率革命与GPU算力优化
📝
🎙️ 硅谷101
📄 随着大模型竞争从训练走向推理部署,AI基础设施(AI Infra)已成为决定模型能否更便宜、更快运行的胜负手。本文围绕大模型推理引擎SGLang、vLLM以及后训练框架Miles的最新实践,深度剖析了AI基础设施的四层架构,系统性解析了KV Cache复用、连续批处理、动静分离、投机采样以及推训一体化等核心优化路径,揭示了如何通过软件与调度层“榨”出硅的极限,从而改变未来AGI的算力生态与竞争格局。 -
vLLM x
TileRT:两个目标相反的推理引擎,为什么开始共用一套服务
🎙️ yage.ai
📄 文章探讨了 vLLM 和 TileRT 这两个目标相反的推理引擎如何通过解耦集成,实现分工协作。核心思想是推理服务正从“单引擎综合最优”转向“专用执行路径的特化与编排”,即保留各自擅长的优化(如高吞吐和低延迟),并通过控制面进行请求的分段和流转,以适应实时交互、长上下文等复杂需求。 -
如何在 Mac 上本地运行 DeepSeek V4 Flash:DS4
引擎深度解读
🎙️ yage.ai
📄 文章介绍了通过 DwarfStar 4 (ds4) 引擎在 Mac 上本地高效运行 DeepSeek V4 Flash 的方案。该引擎通过垂直架构优化、KV cache 磁盘持久化和精准的工具调用原话回放,解决了大模型在消费级硬件上的部署难题,并兼容主流 coding agent 工作流。