标签:scaling-laws
-
对话萨姆·奥特曼:为什么AI变革比想象中更慢?
📝
🎙️ Best Partners TV
📄 本期内容深入解析了萨姆·奥特曼的最新专访,探讨了AI技术与社会经济惯性之间的拉扯、OpenAI从创立到普及的历程、对AI安全与权力集中的警惕,以及YC创业哲学和成功经验对科技创新的深远影响。 -
人工智能、数学突破与资本驱动的经济效用探讨
📝
🎙️ a16z
📄 文章探讨了人工智能在数学领域取得的成就,以及资本如何将工程难题转化为资本问题。分析了数学作为前沿指标的意义,以及在生物医学等领域应用AI的实际情况,并从经济效用和规模法则的角度,讨论了投入巨额资本的潜在风险与机遇。 -
数据质量:被忽视的十倍算力乘数与模型炼制新范式
📝
🎙️ AI Engineer
📄 Datology AI创始人Ari Morcos深入解析了在算力稀缺与推理Token爆炸的背景下,如何通过数据质量(清洗、筛选、生成、组合)作为算力乘数,大幅降低训练和推理成本,并结合汤森路透与RCI的实战案例证明了高性价比定制前沿大模型的可行性。 -
生命与城市的非线性几何:万物皆有其缩放定律
📝
🎙️ Veritasium
📄 本文探讨了生物体与城市在规模缩放上的非线性规律。从1960年代大象注射LSD的悲剧出发,揭示了代谢率随体重呈3/4次幂(克莱伯定律)而非线性变化的奥秘,进而阐述了分形维数与资源输运网络(WBE理论)如何决定哺乳动物的寿命与十亿次心跳极限。最后,将该缩放视角延伸至城市,分析了基础设施的亚线性节约与社会经济产出的超线性增长。 -
关于模型、工具调用与人工智能民主化的技术探讨
📝
🎙️ Latent Space
📄 文章讨论了在复杂任务中,将大型语言模型(LLM)与外部工具和虚拟环境结合的趋势。作者认为过度依赖复杂的工具链可能是一种低效的做法,并回顾了早期研究如何通过对基础模型的深入探索(如循环神经网络到Transformer)来推动代码生成能力的演进。此外,文章还探讨了开源社区在AI发展中的关键作用,强调约束条件如何驱动创新,以及构建内部评估流程和模型打磨的重要性。 -
专访OpenAI总裁:从对话机器人到个人AGI,GPT-5.6与算力终局的深度抉择
📝
🎙️ Best Partners TV
📄 OpenAI总裁Greg Brockman详尽剖析了下一代模型GPT-5.6的全面升级、算力驱动经济下的杰文斯悖论、智能体的信任边界与人机交互重构,以及AI在个性化医疗领域的颠覆性愿景。 -
重构大模型训练的物理学:缩放定律的演进、争鸣与工程陷阱
📝
🎙️ Best Partners TV
📄 本文深度解析大语言模型核心驱动力缩放定律(Scaling Laws)的演进历程,探讨Kaplan与Chinchilla关于计算最优分配的经典分歧及其调和方式,剖析数据墙危机下重复数据的修正模型,并揭示实际拟合过程中的工程陷阱。 -
对话 OpenAI 首席研究官 Mark Chen:关于 AGI、o1、评估危机与 Scaling Laws 的深度探讨
📝
🎙️ Latent Space
📄 在这期特殊的 Latent Space 烹饪访谈中,OpenAI 首席研究官 Mark Chen 与主持人 Alan 边做韩国豆腐汤边畅谈 AI 前沿。对话涵盖了交易员背景对 AI 研究的独特价值、通过复现经典论文培养研究品味、o1 模型背后的强化学习探索过程、面临饱和的评估标准危机,以及大模型如何从“氛围研究”迈向全自动的端到端研究等核心议题。 -
Neocloud 崛起:AI 计算基础设施的深度解析
📝
🎙️ The MAD Podcast with Matt Turck
📄 Lambda 联合创始人兼 CTO Stephen Balaban 深入探讨了 Neocloud 市场的现状与未来。他解释了为什么 GPU 计算从未真正成为商品,分析了从土地、电力到软件编排的垂直整合优势,并讨论了 AI 工厂的融资模式、规模定律的持续有效性,以及“一人一 GPU”的长期愿景。他还分享了 Lambda 从面部识别初创公司到价值数十亿美元云服务商的传奇发展历程。 -
垃圾数据喂出来的大模型,可能比精筛数据更强 · 乔木博客
🎙️ 向阳乔木
📄 斯坦福大学研究表明,在大规模计算条件下,未经任何过滤的原始网络爬虫数据训练大模型,效果优于经过精心过滤的数据。研究解释了垃圾数据与有效任务在大模型内部的隔离机制,指出数据过滤在更大规模训练中可能不再必要,强调了计算扩展能力的潜力。 -
Microsoft AI 发布 MAI-Thinking-1
技术报告:训练大模型不是造火箭,是攀岩
🎙️ yage.ai
📄 本文深度解读了Microsoft AI的MAI-Thinking-1技术报告,指出顶尖实验室的研发优势在于构建了一套基于第一性原理的“攀爬机器”思维框架。该框架强调通过小规模模型到大规模模型的缩放趋势分析(Efficiency Gain指标)来辅助研发决策,接受架构创新初期的训练效率波动,并强调系统性的实验设计与工程优化的闭环能力,而非仅依赖单一的训练技巧。 -
跨越不确定性之锥:Anthropic CFO 深度拆解算力霸权与指数级增长逻辑
📝
🎙️ Best Partners TV
📄 Anthropic CFO Krishna Rao 在专访中系统披露了公司的算力采购生死局、跨平台硬件灵活性、以及从 90 亿到 300 亿美金年化收入的指数级飞跃,并定义了 AI 驱动内部效率革新与负责任研发的核心壁垒。 -
超越U-Net:Transformer在扩散模型中的高效与稳定表现 · 乔木博客
🎙️ 向阳乔木
📄 本文介绍了 Diffusion Transformers (DiT) 如何用 Transformer 架构取代扩散模型中的 U-Net,并证明了 Transformer 的规模扩展定律同样适用于图像生成。文章强调 Gflops 是比参数量更关键的性能指标,详细阐述了 DiT 的 Patchify、条件注入(adaLN-Zero)及训练稳定性,并指出其对 Stable Diffusion 3、FLUX.1 和 Sora 等后续模型发展产生了深远影响,标志着扩散模型进入了与语言模型一致的 Transformer 发展轨道。 -
机器人终局之战:具身智能的未来与大模型的平行路径
📝
🎙️ Best Partners TV
📄 英伟达Jim Fan在AI Ascent峰会上阐述具身智能的未来,提出机器人应复制大语言模型的成功路径,通过‘伟大的平行’,构建世界动作模型(WAM)并利用第一人称视频数据,以Real-to-Sim-to-Real闭环加速强化学习,最终迈向物理图灵测试、物理API和物理自动研究三大里程碑,预测2040年前实现机器人技术的终局。 -
OpenAI 联合创始人 Greg Brockman 深度专访:从初创风云到算力指数级的未来展望
📝
🎙️ The Knowledge Project Podcast
📄 OpenAI 联合创始人 Greg Brockman 回顾了公司的起源、从非营利转向营利实体的底层逻辑,以及 2023 年 11 月内部动荡的始末。他深入探讨了算力(Compute)作为未来经济基石的重要性,阐述了“迭代部署”的策略,并描绘了一个每个人都能通过 AI 成为“建设者”的未来愿景。 -
训练一个大语言模型到底有多难
🎙️ yage.ai
📄 本文深入探讨了训练大语言模型的严峻挑战,涵盖了硬件故障、计算效率(MFU)、数值精度、数据限制及资源规划等六个维度。文章指出,其难度源于大规模和高成本下众多工程问题的叠加,而非单一瓶颈,并提供了一个评估 LLM 训练能力的框架。 -
对话 Marc Andreessen:AI 的“八十年爆发”、浏览器的终结与代理(Agent)的崛起
📝
🎙️ Latent Space
📄 硅谷传奇风投家 Marc Andreessen 深入探讨了人工智能的发展历程,称其为“80年的通宵成功”。他分析了为何当前的推理、代理与编码突破具有转折意义,提出了基于 Unix 哲学的 Agent 架构,并讨论了 AI 如何重塑软件工程、资本主义管理模式以及应对社会制度性阻碍的挑战。 -
吴恩达:AGI的现实与未来——拨开AI行业的迷雾
📝
🎙️ Best Partners TV
📄 吴恩达深入剖析2026年AI行业现状,质疑AGI定义,提出Turing-AGI Test,探讨Agentic AI、Scaling Laws及持续学习瓶颈。他警告过度炒作将引发泡沫,并强调AI增强而非替代人类,呼吁教育改革与开源发展。 -
撕开硅谷AI遮羞布:从黑盒困境到真实世界的千亿金矿
📝
🎙️ Best Partners TV
📄 门洛风投合伙人 Deedy Das 深度剖析当前 AI 泡沫,揭示深度学习的“黑盒困境”及机制可解释性的重要性。他指出硅谷精英视角与传统产业需求的严重断裂,强调在全球人口缩减背景下,AI 自动化是应对劳动力危机的唯一解药,并分享了追求底层产品力的重仓投资哲学。 -
Greg Brockman(OpenAI 联合创始人)把“那场宫斗”讲完整了:董事会、请愿书、马斯克与控制权 | 宝玉的分享
🎙️ baoyu.io
📄 本文详细记录了 OpenAI 联合创始人 Greg Brockman 的深度访谈,聚焦内部权力斗争、员工团结及为 AI 使命付出的牺牲。Brockman 探讨了 AI 规模化挑战、算力稀缺性及未来地位,介绍了 GPT 模型飞跃及“Agent-first”理念。他还回顾了 OpenAI 早期、与马斯克的谈判,并反思了智能本质与冲突管理。文章揭示了 AI 发展与社会适应间的议题,强调了韧性与自我赋权。 -
Anthropic CEO Dario Amodei:海啸已在地平线上,但没人在看 | 宝玉的分享
🎙️ baoyu.io
📄 这篇访谈聚焦 Anthropic CEO Dario Amodei 对 AI 发展的看法。他认为 AI 技术正以前所未有的速度进步,但社会对此缺乏足够认知,犹如海啸即将来临。Amodei 强调了 AI 安全、规模定律(scaling laws)、AI 意识以及权力集中等关键议题,并就 AI 对工作、生物科技和创业机会的影响发表了见解。他呼吁社会积极适应 AI 带来的变革,同时警惕潜在风险。 -
AI 2026:中国开源崛起、后训练革命与多维扩展的未来
📝
🎙️ Best Partners TV
📄 本次访谈深入解析了2026年AI行业的关键趋势。内容涵盖了从中国开源模型(如DeepSeek)的崛起及其对Meta Llama的挑战,到闭源模型(Anthropic Claude Opus 4.5, Google Gemini 3, OpenAI GPT-5)的最新进展。访谈重点介绍了AI进入后训练时代,特别是RLVR技术的重要性,以及AI对编程模式的颠覆性影响。此外,还探讨了Scaling Laws的多维扩展、AGI的未来(多Agent与专业化模型),以及AI开发者的职业建议、行业文化与商业整合。最后,展望了文本扩散模型、工具调用、硬件发展及AI与人类文明的长远关系。 -
世界模型:AGI的关键拼图与AI的未来图景
📝
🎙️ Best Partners TV
📄 本文深入探讨了DeepMind资深研究员达尼贾尔·哈夫纳关于世界模型的观点,阐述了其作为实现通用人工智能(AGI)的关键技术。文章详细介绍了DeepMind在世界模型领域的三条主要研究路线(Genie, Veo, Dreamer),并分析了Dreamer系列模型在在线与离线学习上的突破。同时,探讨了AGI实现的关键因素(计算资源、目标函数、数据、算法细节),AI模型的多模态融合趋势,以及长上下文理解、超越人类推理等核心能力缺口。此外,还讨论了上下文学习的局限性、神经科学的启发、视频模型Scaling Laws的巨大潜力,以及世界模型在机器人领域的颠覆性影响和对大模型幻觉问题的解释。 -
AI已入死胡同?Transformer的局限与CTM的曙光
📝
🎙️ Best Partners TV
📄 本文探讨了AI领域当前面临的困境,即对Transformer架构的过度依赖和“Scaling至上”的趋势。Llion Jones警告称,当前研究已陷入局部最优,并提出“锯齿状智能”问题。文章介绍了Sakana AI提出的生物启发式新架构CTM,强调了跳出路径依赖、探索全新范式的重要性,并呼吁重构AI研究的评价体系和资源分配机制,以激发真正的创新。 -
德米斯·哈萨比斯:AGI十年愿景与AI的未来之路
📝
🎙️ Best Partners TV
📄 Google DeepMind CEO德米斯·哈萨比斯在最新访谈中,预测AGI将在五到十年内实现,并深入探讨了当前AI的技术瓶颈,如Scaling Law的收益递减和推理能力的缺失。他强调了“世界模型”作为实现AGI的关键创新,并阐述了AI如何成为解决能源危机、气候变化等全球性挑战的利器。同时,他也谈及了AI安全风险、Google的战略调整、AI泡沫以及边缘计算和智能眼镜作为未来杀手级应用的前景。 -
Engram架构:DeepSeek突破Transformer性能瓶颈的新方案
📝
🎙️ Best Partners TV
📄 DeepSeek发布Engram架构论文,提出一种全新的条件记忆机制,旨在提升MoE模型处理语言信息效率。Engram通过解耦计算与存储,实现更低的成本和更优的性能,并为模型提供了可预测的Scaling手段,有望成为下一代稀疏模型的重要组成部分。 -
从算力堆叠到逻辑深度:Ilya Sutskever 论 AI 研究时代 2.0 与超级智能的演进
📝
🎙️ Best Partners TV
📄 本文深度解析了前 OpenAI 首席科学家 Ilya Sutskever 关于 AI 范式转移的核心洞见。探讨了 AI 如何从依赖海量数据的 Scaling 时代迈向以算法创新和推理侧计算为核心的“研究时代 2.0”。文章涵盖了生物智能的进化启示、推理侧 Scaling 的技术路径、SSI 的极简主义策略,以及人类与超级智能共生的终极方案。 -
AI 巨头 Anthropic 的生存之道:安全、务实与超越 AGI 的愿景
📝
🎙️ Best Partners TV
📄 本文深入探讨了 **Anthropic** 联合创始人丹妮拉·阿莫代伊的访谈。内容涵盖公司从 **OpenAI** 分拆的起源、在资源劣势下如何通过高质量团队和务实价值观打造 SOTA 模型,其聚焦 B 端市场的商业策略,以及多云平台和激进透明的安全理念。文章还分析了 AI 泡沫、AGI 概念的演变,并展现了核心团队的互补领导力,勾勒出 Anthropic 在 AI 浪潮中走出差异化道路的历程。 -
大模型依赖记忆而非智能:解读Scaling Law下的核心误区
📝
🎙️ Dwarkesh Patel
📄 该讲稿探讨了通用智能与技能的本质区别,指出当前大型语言模型(LLM)主要擅长技能习得和基于模式匹配的“记忆式推理”,而非真正的通用智能。通过分析Scaling Law和基准测试,文章揭示了模型表现的提升更多源于记忆能力的增强,而非智能本身。它强调了区分记忆与推理的重要性,并指出虽然记忆是推理的基础,但真正的智能在于即时合成新解决方案的能力。 -
AI智能的演进:预测的迷思与能力的飞跃
📝
🎙️ Dwarkesh Patel
📄 本文探讨了AI模型发展的不可预测性,揭示了智能并非单一光谱,而是多维度能力的总和。演讲者Dario Amodei分享了AI在特定任务上的超人表现与在复杂推理上的局限,并反思了模型规模、数据量与生物大脑的差异。尽管当前AI尚未实现重大科学发现,但其“普通创造力”及庞大知识储备预示着未来在复杂领域(如生物学)的突破潜力,模型正站在协同发现的边缘。