标签:model-training
-
一台 PC 工作站上的 13
小时训练实验:为什么做优化的前提是测量?
🎙️ yage.ai
📄 本文通过一个在个人工作站上进行的模型训练实验,展示了在模型优化过程中,先进行实际测量(使用 Profiler)的重要性。实验结果表明,通过系统性地测量和分析训练过程中的时间分布,可以精准定位性能瓶颈,从而指导优化方向,避免在未经测量的情况下盲目进行代码修改或伪优化。 -
英伟达为什么做开源大模型?对话 Nemotron 掌门人布莱恩·卡坦扎罗
📝
🎙️ Best Partners TV
📄 本期由大飞解读英伟达应用深度学习研究副总裁布莱恩·卡坦扎罗的深度专访。内容探讨了英伟达投入巨资研发并开源 Nemotron 大模型的底层商业与技术逻辑,深入剖析了4位精度预训练、混合架构、隐式 MoE 等前沿技术突破,并分享了关于开源安全、中美 AI 竞争及奇点理论的独特见解。 -
顶级模型 Fable/Mythos 是如何训练出来的? · 乔木博客
🎙️ 向阳乔木
📄 文章探讨了顶级模型如 Fable/Mythos 的训练机制,核心观点在于模型的性能取决于基础底座与可验证奖励信号的质量。作者详细阐述了从高密度预训练、可验证强化学习(GRPO)、测试时算力筛选到长流程管理等六个层次的训练流程,强调‘可验证经验’是模型能力的关键,而非单纯的网络结构或参数量。 -
Zed 2 模型训练:生产环境下的编辑预测模型构建详解
📝
🎙️ AI Engineer
📄 本文详细介绍了 Zed 公司如何构建其编辑预测模型 Zed 2。内容涵盖了从生产环境数据收集、使用‘教师模型’进行蒸馏训练,到‘已定数据’概念的引入及其过滤方法。同时,文章还阐述了模型评估、优化训练数据以及在生产环境中进行实验部署的策略,旨在提升代码编辑的智能化体验。 -
模型即产品:Anthropic 如何研发下一代 Claude
📝
🎙️ Best Partners TV
📄 Anthropic 研究产品经理 Alex Albert 深度拆解 Claude 的开发全流程。内容涵盖将大模型视为标准化互联网产品进行管理、利用 AI 修正 AI 的高效迭代闭环、'做梦'记忆机制、严谨的性格塑造、以及 AI 重塑产品经理工作流的实战经验。 -
开启 AI 工程师助手:构建开放智能体生态系统
📝
🎙️ AI Engineer
📄 演讲者 Merve Noyan 介绍了如何利用 Hugging Face 生态系统构建开放的智能体(Agent)工作流,包括本地部署编码智能体、利用自然语言进行模型训练、以及集成 Model Context Protocol (MCP) 实现任务自动化。 -
Manus 和 Cursor 的认知领先:技术路线与结果验证
🎙️ yage.ai
📄 文章分析 Manus 和 Cursor 的技术认知优势,驳斥“套壳”论。Manus 凭借 Agent 架构与用户生成软件模式领先;Cursor 则通过自研模型与 Harness Engineering 在编程领域建立壁垒。两者将认知优势转化为成果,获市场高度认可,代表行业第一梯队。 -
罗福利:OpenClaw、智能体框架——AI范式已剧烈改变
📝
🎙️ Zhang Xiaojun Podcast
📄 小米大模型负责人罗福利深入探讨了OpenClaw发布后,AI技术范式的剧烈变迁。她认为OpenClaw作为划时代的智能体框架,通过精巧编排弥补了模型短板,极大地提升了中层模型的上限,并加速了研究效率。访谈还涵盖了小米MiMA系列模型(Flash、Pro、Omnimode、TTS)在长上下文、推理效率、多模态融合方面的技术决策,以及团队管理、AGI发展路径、中美差距和未来竞争焦点等议题。罗福利强调了群体智能、开源协作和对技术的热爱在推动AI进步中的关键作用。 -
算力不是唯一瓶颈:PPO之父约翰·舒尔曼深度解读AI崛起之路与未来趋势
📝
🎙️ Best Partners TV
📄 OpenAI创始元老约翰·舒尔曼在访谈中指出,算力并非AI发展的唯一瓶颈,技术方法和巧思同样重要。他回顾了OpenAI的早期探索、失败与成功项目,并分享了对强化学习趋势、AGI时间线预测的见解。同时,他介绍了新公司Thinking Machines推出的底层微调API产品Tinker,旨在降低AI创业门槛。舒尔曼强调了工程技能的重要性以及AI辅助研究的潜力,并认为AI的进步更多依赖于方法论的创新而非单纯的算力堆砌。 -
mHC架构:DeepSeek突破规模瓶颈,重塑大模型训练新范式
📝
🎙️ Best Partners TV
📄 AI行业在规模竞赛中面临成本与效率瓶颈。DeepSeek发布的mHC架构,通过引入双随机矩阵流形约束和高效基础设施优化(算子融合、选择性重计算等),解决了传统超连接(HC)带来的训练不稳定和显存消耗问题。mHC在提升模型稳定性和性能的同时,显著降低了训练成本,为大模型商业化落地和中小企业参与AI革命开辟了新路径。