标签:model-optimization
-
大语言模型推理技术工作坊:从第一性原理到生产级部署与选型
📝
🎙️ AI Engineer
📄 本次工作坊旨在帮助初级和中级工程师深入理解大语言模型推理的底层机制、核心痛点(如成本、显存、延迟)以及模型优化和推理服务架构的优化策略。内容涵盖模型量化、注意力机制演进(MQA/GQA/MLA)、主流推理引擎(vLLM, SGLang, TensorRT-LLM)的选型决策,并探讨了KV Cache管理和分布式推理等进阶方向。
-
vLLM 背后的人:一个开源项目如何长成一家公司 · 乔木博客
🎙️ 向阳乔木
📄 本文探讨了开源项目 vLLM 从算法研究转向系统工程的演变过程,以及其背后的商业化逻辑。文章阐述了从算法研究到系统工程的转变,强调系统和数据对模型成败的重要性,并分析了 DeepSeek 等公司在推理引擎优化上的实践,以及开源社区治理的挑战和创业的必要性。
-
本地AI峰会圆桌讨论:为什么是本地,为什么是现在?
📝
🎙️ AI Engineer
📄 本篇圆桌对话围绕本地AI的爆发性拐点、多模型混合架构、模型量化调优、数据主权以及开源生态建设展开。NVIDIA、Osmantic、Roboflow和EXO Labs的专家深入探讨了企业如何利用前沿大模型微调小模型以提高Token效益,并分享了在有限边缘端算力下压榨出十倍推理性能的实战案例,指出降低体验门槛和积极倡导开源对本地AI落地的关键意义。
-
Scaling Law
塌房了吗?三次修正的真实故事,和越来越小的模型
🎙️ yage.ai
📄 文章探讨了Scaling Law(缩放定律)在大型语言模型训练中的演变和修正过程。它分析了从2020年OpenAI的初始假设到Chinchilla论文提出的参数与数据配比修正,以及后续行业对推理成本纳入考量的变化。核心观点是Scaling Law并非物理定律,而是一条依赖实验条件的经验拟合曲线,模型的优化目标随着训练和部署阶段的变化而不断调整。
-
对话高通副总裁:端侧AI、6G与Physical AI生态的未来展望
📝
🎙️ 硅谷101
📄 本视频深入探讨了高通在全球AI浪潮中,如何通过端侧AI、6G通信技术以及不断发展的智能体生态,驱动AI手机、AIPC、XR设备、汽车和机器人等边缘设备的创新与落地。高通公司全球副总裁徐晧详细阐述了端侧AI在模型小型化、算力优化和异构架构支持方面的技术挑战与解决方案,并对AI在不同终端形态中的应用前景及未来交互范式的变革进行了展望。讨论强调了高通在芯片、通信与AI融合领域的深厚布局,旨在实现AI的普惠化应用。
-
Reachy Mini:打破高昂壁垒,重构开源机器人的语音交互范式
📝
🎙️ AI Engineer
📄 Hugging Face 的 Andres 探讨了当前机器人领域高昂的成本壁垒,并推出了仅售300美元的开源机器人 Reachy Mini。该项目结合了成熟的开源语音AI与端到端架构优化(如深度加速Coqui TTS),旨在将机器人开发权交还给开发者、学生与创客,探索非拟人化的全新交互可能。
-
DeepSeek-V4预览版技术深度解析:百万上下文、效率革新与Agent能力飞跃
📝
🎙️ Best Partners TV
📄 DeepSeek发布V4预览版,包含Pro和Flash两款模型,原生支持100万token上下文。其核心使命是重构超长上下文计算效率,为下一代大模型范式奠定基础。报告深入解读了其三大核心架构革新(混合注意力、流形约束超连接、Muon优化器)、全栈工程优化及“分化再统一”的后训练范式。DeepSeek V4在多项评测中表现卓越,尤其在长上下文和Agent能力上实现突破,同时坦诚未来迭代方向。
-
DSPy:终结提示工程,构建模块化LLM程序
📝
🎙️ AI Engineer
📄 本讲座深入探讨了DSPy框架,一个声明式、模块化的软件构建方法,将大型语言模型(LLMs)视为一等公民。讲者详细介绍了DSPy的核心概念,包括签名、模块、工具、适配器、优化器和度量,并通过代码示例展示了其在情感分类、多模态RAG、文档分析及优化模型性能方面的应用。强调DSPy通过编程抽象实现模型可迁移性和成本效益,而非仅仅是提示词工程。