标签:quantization
-
大语言模型推理技术工作坊:从第一性原理到生产级部署与选型
📝
🎙️ AI Engineer
📄 本次工作坊旨在帮助初级和中级工程师深入理解大语言模型推理的底层机制、核心痛点(如成本、显存、延迟)以及模型优化和推理服务架构的优化策略。内容涵盖模型量化、注意力机制演进(MQA/GQA/MLA)、主流推理引擎(vLLM, SGLang, TensorRT-LLM)的选型决策,并探讨了KV Cache管理和分布式推理等进阶方向。 -
8 路并发每路仍有 141 tok/s:2×5090 跑 27B
小模型,为什么它已经是 sweet spot
🎙️ yage.ai
📄 文章探讨了在本地自托管 27B 小模型时,如何通过优化硬件配置(如 2×5090)和推理引擎(如 SGLang DFlash2)来达到性能甜蜜点(sweet spot)。核心论点在于,自托管的价值不在于单纯的成本节约,而在于对数据合规性、隐私控制和推理栈的完全掌控。文章通过详细的并发压测数据,论证了在特定负载下,消费级硬件可以提供充裕的解码吞吐,并对比了自建与云端租赁的经济决策变量,强调了使用率对成本效益的决定性影响。 -
端侧智能重构:从 Gemma 2B 极致压缩到百M级极小模型的微调实战
📝
🎙️ AI Engineer
📄 谷歌端侧 AI 团队技术主管 Cormac Brick 深度解析了端侧大模型的最新技术进展。文章对比了 1-4B 小模型与 50M-500M 极小模型的适用场景,探讨了 2.9-bit 混合量化等内存压缩技术,分享了树莓派、Jetson Nano 和高通等硬件的端侧跑分,并给出了通过合成数据微调极小模型以实现高精度端侧语音函数调用的完整实操指南。 -
腾讯混元 Hy3 的 1-bit
量化:单卡能装下,离好用还有多远
🎙️ yage.ai
📄 文章介绍了腾讯混元发布的 Hy3 模型及其量化版本(如 IQ1_M),重点分析了模型压缩(如 1-bit 量化)对显存占用、运行可靠性以及生成速度的影响。核心观点是,虽然量化能显著减少权重文件大小并适应有限的硬件,但它也带来了上下文长度缩短和复杂任务可靠性可能下降的风险,最终建议用户根据实际工作流进行 A/B 测试。 -
AI算力革命:硬件如何驱动深度学习的爆发
📝
🎙️ Best Partners TV
📄 本文深入剖析AI算力爆炸背后的硬件创新,揭示其非源于摩尔定律,而是架构演进的功劳。涵盖数字表示、指令集、稀疏性、系统扩展,并预警Agent推理瓶颈,展望对数表示等未来方向,强调能耗与可编程性。