标签:pre-training
-
谷歌DeepMind CTO专访:坦承当前模型差距与Gemini 4研发进展
📝
🎙️ Best Partners TV
📄 谷歌DeepMind首席技术官Koray Kavukcuoglu在访谈中坦言当前模型质量略微落后于行业最前沿,但重申保持前沿是最高优先级。他回顾了从雅达利DQN到大模型的研究历程,深度解析了Gemini 3.5至3.7快速迭代的工程积累、Gemini 4最具雄心的预训练进展及通往AGI的探索路径。 -
超越IPO:Anthropic如何下出AI商业世界的一盘大棋
📝
🎙️ TechButMakeItReal
📄 本期深度解析了Anthropic在短短90天内的连环战略布局。面对被特朗普政府封杀的危机,Anthropic不仅巧妙利用梵蒂冈获得道德背书、借助KPMG打通企业级市场分发,更通过招募Andrej Karpathy探索“用AI加速AI研究”以破解算力成本难题。Anthropic正在构建一套超越上市的全新权力结构。 -
Microsoft AI 发布 MAI-Thinking-1
技术报告:训练大模型不是造火箭,是攀岩
🎙️ yage.ai
📄 本文深度解读了Microsoft AI的MAI-Thinking-1技术报告,指出顶尖实验室的研发优势在于构建了一套基于第一性原理的“攀爬机器”思维框架。该框架强调通过小规模模型到大规模模型的缩放趋势分析(Efficiency Gain指标)来辅助研发决策,接受架构创新初期的训练效率波动,并强调系统性的实验设计与工程优化的闭环能力,而非仅依赖单一的训练技巧。 -
谷歌AI核心科学家Andrew Dai访谈:14年历程、Gemini翻身仗与视觉推理新纪元
📝
🎙️ 硅谷101
📄 前谷歌AI核心科学家Andrew Dai回顾14年谷歌生涯,探讨了谷歌在AI大模型竞赛中的挑战与Gemini的崛起。他深入分析了Google Brain与DeepMind合并的摩擦、数据优化在模型发展中的关键作用,并阐述了其创立Allorian AI、专注多模态视觉推理以期超越大语言模型局限的创业愿景。 -
对话 Amazon AGI 专家:大模型训练的深水区,从算力基建、数据洗练到 AI 自进化的终局
📝
🎙️ 课代表立正
📄 本访谈由 Amazon AGI 高级经理查晟深度拆解大模型预训练的核心技术栈。内容涵盖 Scaling Laws 的实操坑点、科研中“最大化信息增益”的方法论、算力集群在 backward 阶段的电力冲击挑战,以及行业内 Benchmark 泄露与刷分的现状。查晟进一步预测了 AI 将从“答题”转向自主“出题”的自进化阶段,并探讨了智能商品化后对人类职业路径与宏观经济的深远影响。 -
Token级数据过滤:重塑AI安全的新范式
📝
🎙️ Best Partners TV
📄 本研究提出Token级数据过滤技术,一种颠覆性的AI安全方法。它在模型预训练阶段精准识别并移除危险知识碎片,而非事后压制。该技术能有效隔离AI的危险能力,同时保留其通用智能,尤其在大模型上效果显著,并提供更具成本效益和鲁棒性的AI安全解决方案。