标签:mixture-of-experts
-
重构算力经济学:中国AI开源权重的商业突围与地缘博弈
📝
🎙️ TechButMakeItReal
📄 本文深入探讨了中国AI实验室(如DeepSeek)免费公开前沿大模型权重的底层商业逻辑。通过厘清开源权重、开源代码与闭源API的定义和界限,揭示了混合专家模型(MoE)带来的单位算力成本优势。同时,分析了硬件巨头英伟达在开源生态中的受益机制,以及西方闭源阵营以模型安全为叙事、实质维护自身定价权的商业与地缘博弈。 -
大模型规模化的喧嚣与真实:合成数据策略与分布式预训练工程实操
📝
🎙️ AI Engineer
📄 本文深入探讨了 poolside 在训练 Laguna 系列(包括 Laguna M.1、XS.2 及最新 118B MoE 架构的 Laguna S)模型时的前沿实践。文章详细介绍了 poolside 的合成数据流水线设计(包括多阶段生成、跨域迁移和双角色演进等四种核心模式),以及在大规模分布式预训练中,如何通过模型副本哈希校验(Model Replica Hash Checks)、FP32 精度积累和解决开源 DeepGemm FP8 算子中的竞态条件,来应对静默数据损坏与梯度爆炸等工程挑战。 -
E251 Kimi K3全解读:中国AI第一次摸到前沿了吗 | 透明茶室 • 分析线
📝
🎙️ FearNation 世界苦茶
📄 本期内容围绕月之暗面发布的Kimi k1.5(讲稿中称k0.3/k3)展开深度剖析。结合Artificial Analysis(AA)独立评测机构的数据,详细对比了Kimi与GPT-4o在Harvey Lab、Banking、LCR、Briefcase、HLE、CRUX物理推理及OmniScience等核心Benchmark上的表现。分析指出Kimi在封闭长文本、多步骤Agentic工具调用及商业分析交付上具备顶尖优势,但基座模型(Base Model)在长尾知识覆盖、新知识生产与单次任务推理准确性上仍存短板。同时探讨了其稀疏MoE架构、Delta Attention与MLA注意力机制的利弊及商业化前景。 -
开源的极限跨越:月之暗面 Kimi K3 三万亿参数模型的架构创新、多维评测与行业重构
📝
🎙️ Best Partners TV
📄 本文深度解析月之暗面发布的全球首个三万亿级开源模型 Kimi K3。从其三大架构创新(KDA、AttnRes、Stable Latent MoE)出发,详述其在前端编程、自主芯片设计、科研编码以及多模态剪辑等长程 Agent 任务中的突破性表现,并深入剖析其定价策略与地缘政治下 AI 开源与闭源的博弈格局。 -
英伟达为什么做开源大模型?对话 Nemotron 掌门人布莱恩·卡坦扎罗
📝
🎙️ Best Partners TV
📄 本期由大飞解读英伟达应用深度学习研究副总裁布莱恩·卡坦扎罗的深度专访。内容探讨了英伟达投入巨资研发并开源 Nemotron 大模型的底层商业与技术逻辑,深入剖析了4位精度预训练、混合架构、隐式 MoE 等前沿技术突破,并分享了关于开源安全、中美 AI 竞争及奇点理论的独特见解。 -
他在谷歌深耕14年,亲手种下GPT的种子,却只能看OpenAI收割 · 乔木博客
🎙️ 向阳乔木
📄 谷歌 AI 老将 Andrew Dai 在谷歌深耕 14 年,深度参与了 Transformer 及多模态大模型研发,但因大厂组织官僚体系错失先机。文章探讨了模型架构与数据质量对 AI 竞争的关键作用,以及 Andrew Dai 离职后创立 Aloran AI,试图通过“语言逻辑+视觉推理”的中间路线探索视觉 AGI 的前沿方向。 -
AI 终于学会"听歌起舞"了,而且跳得比人类还整齐 · 乔木博客
🎙️ 向阳乔木
📄 文章介绍了 MACE 模型,通过级联混合专家架构(MoE)实现了高质量、音乐驱动的舞蹈视频生成。该模型将动作生成与视频渲染分离,结合 BiMamba、扩散模型及 GFT 等技术,并在自建的 MA-Data 数据集上进行了训练,在动作同步性和视频视觉质量上均达到 SOTA 水平,并展示了 MoE 架构在复杂 AI 任务中的优势。 -
Gemma 4 技术全解:Google DeepMind 如何重塑高效模型与原生多模态架构
📝
🎙️ AI Engineer
📄 Google DeepMind 研究员 Cassidy Hardin 深度解析了最新发布的 Gemma 4 系列模型。本文涵盖了 2B/4B 端侧模型、26B MoE 以及 31B 稠密模型的架构创新,重点探讨了局部与全局注意力交替机制、层级嵌入(PLE)存储优化,以及支持可变分辨率的原生多模态处理逻辑。 -
法国AI新星Mistral如何打破美国垄断?低成本、主权至上与地缘政治新格局
📝
🎙️ House of El - AI
📄 Mistral AI作为欧洲崛起的AI公司,在三年内估值达140亿美元,其成功在于推行开源模式、强调数据主权和技术自主,并采用创新专家混合架构将运行成本降低70-90%。在法国政府支持下,Mistral正成为欧洲AI“第三方力量”的核心,重塑全球AI竞争格局,尤其在AI基础设施战略性日益凸显的背景下,为各国提供了摆脱美国科技巨头依赖的替代方案。 -
大模型技术版图:Transformer坚守与后训练革新
📝
🎙️ Best Partners TV
📄 本文基于塞巴斯蒂安·拉施卡访谈,深入剖析2026年大语言模型(LLM)的技术现状与未来趋势。探讨了Transformer架构的持续主导地位、混合专家模型(MoE)的普及、世界模型与内部状态预测等新训练目标。重点阐述了RLVR和GRPO等后训练范式如何驱动性能飞跃,小型推理模型的兴起及其与通用大模型的协同作用,以及推理扩展和工程细节优化对用户体验的提升。强调AI进步是持续迭代的累积,而非单一突破,并介绍了拉施卡以热情和实践驱动的学习工作方式。