标签:model-scaling
-
中国大模型两代传承与SOTA模型的探索精神
📝
🎙️ 硅谷101
📄 文章回顾了中国AI领域两代公司的发展脉络,从计算机视觉到大语言模型。重点探讨了开源模型在追赶SOTA闭源模型时的机遇,以及创业公司在资源匮乏环境下的AGI探索精神、人才传承机制和商业模式的取舍。 -
K3 用早期的自己优化了自己,这比 2.8 万亿参数更值得琢磨 · 乔木博客
🎙️ 向阳乔木
📄 文章探讨了Kimi K3模型在开源领域的核心价值,强调其不仅体现在参数规模(2.8万亿)上,更在于其在模型优化自身训练基础设施和底层代码(如GPU kernel优化、自建编译器)方面的能力。核心观点是,模型开始成为训练自身基础设施的贡献者,这种自我指涉的循环是其持续领跑的真正原因,标志着AI范式正从单纯的模型性能竞赛转向模型对生产系统的优化能力。 -
别只看 42.7%:Tmax 背后的 RL 配方、基座红利和
Benchmark 陷阱
🎙️ yage.ai
📄 文章分析了Tmax模型在开源小模型领域如何通过特定的强化学习配方和基座红利,在终端Agent任务中实现性能突破。核心观点在于,模型表现的提升不仅依赖于绝对分数,更取决于数据集、训练信号设计、评估环境稳定性以及奖励函数对任务定义的精确对齐等多个变量的综合考量。 -
算力就是命脉:Anthropic CFO 谈计算资源、模型智能与企业增长 · 乔木博客
🎙️ 向阳乔木
📄 本文介绍了Anthropic CFO Krishna Rao关于算力调度、模型迭代与企业增长的深度思考。Anthropic通过多平台算力部署、模型推理效率优化及内部AI开发赋能,实现了指数级营收增长。文章还探讨了面对AI能力突变时的发布策略及算力作为核心资产的经济学逻辑。 -
规模化构建生成式音视频模型:Google DeepMind 的幕后技术洞察
📝
🎙️ AI Engineer
📄 本文由 Google DeepMind 研究科学家 Sander Dieleman 分享,深入探讨了训练大规模扩散模型的核心环节。内容涵盖了数据清洗的重要性、潜空间表示(Latent Representation)的原理、扩散过程的频域分析、Transformer 架构的演进、采样引导(Guidance)的威力以及模型蒸馏与控制信号的最新进展,揭示了 Veo 等前沿模型背后的技术细节。 -
Token级数据过滤:重塑AI安全的新范式
📝
🎙️ Best Partners TV
📄 本研究提出Token级数据过滤技术,一种颠覆性的AI安全方法。它在模型预训练阶段精准识别并移除危险知识碎片,而非事后压制。该技术能有效隔离AI的危险能力,同时保留其通用智能,尤其在大模型上效果显著,并提供更具成本效益和鲁棒性的AI安全解决方案。