标签:large-language-model
埃尔德什猜想的终结:AI如何将数学家的“终极游乐场”重塑为技术竞技场
📝
🎙️ Best Partners TV
8/28/2026
📄 本文系统记录了2026年AI在数学领域取得的突破性进展。以保罗·埃尔德什的悬赏问题为切入点,探讨了从外包客服到菲尔兹奖得主陶哲轩在社区中的扁平协作,以及Google DeepMind和OpenAI在解决数十年未解猜想上的技术交锋,反映了AI对数学研究范式的深刻重塑。
百川智能掉队重围:王小川的‘医疗自洽’与联创退场之后的非共识豪赌
📝
🎙️ Best Partners TV
8/6/2026
📄 本文深度解析了百川智能在人工智能大模型创业浪潮中的战略转型与组织变迁。随着最后一位联合创始人茹立云的离职,百川智能早期创始团队已悉数流失。文章详述了王小川力排众议放弃通用大模型、转向AI医疗的决策背景,剖析了其基于搜狗成功经验的路径依赖,以及在Scaling Law算力黑洞与Coding等Agent应用爆发的时代交错中,百川智能所面临的壁垒重构与自洽困局。
大模型会讲因果,是因为人类为它解释了世界
📝
🎙️ Best Partners TV
8/5/2026
📄 本期视频探讨了图灵奖得主、因果推理奠基人Judea Pearl对大模型与AGI关系的深刻洞察。Pearl指出,大模型能回答因果问题,是因为其训练语料中早已混入人类对世界的因果解释。大模型本身只处于因果阶梯第一层的统计关联,无法独立完成观察、干预和反事实的闭环。要实现真正的AGI,必须将统计学习与因果世界模型结合,发展出具备自主探索与逻辑推演能力的因果AI。
终结刷榜瘟疫:大语言模型基准测试的异化与重构
📝
🎙️ AI Engineer
8/2/2026
📄 本文探讨了人工智能行业中基准测试刷榜(Benchmaxxing)现象的根源,深入剖析了高昂制作成本、数据污染、奖励黑客以及硬编码验证等导致基准测试失真的核心反模式,并提出以专业人类专家盲测为基础的质量最大化重构路径。
硬核拆解DeepSeek泄露会议:最顶级的精明,看起来往往像“理想主义”
📝
🎙️ 人民公园说AI
7/30/2026
📄 本期访谈深度拆解了DeepSeek创始人梁文锋泄露的4小时闭门会议内容。嘉宾们围绕“克制”这一商业方法论,分析了DeepSeek基于算力硬件10个月回本、6倍定价的精明财务逻辑与定价权,并探讨了从大语言模型、思维链、Agent到具身智能的自迭代路径,以及绕开英伟达生态的可能性。
人脑气候预报:AI合成角色的技术原理、失效模式与前沿实践
📝
🎙️ AI Engineer
7/29/2026
📄 本文深入探讨了AI合成角色(Synthetic Personas)在市场研究中的技术原理、三大失效模式(隐性混淆变量、提示词敏感性与知行鸿沟),并介绍微调与语义分布映射等前沿优化技术,阐明其作为“天气预报”式概率预测工具与人类研究的互补协作关系。
如何提升强化学习的训练效率:大模型RL训练的算力瓶颈与吞吐量匹配深度解析
📝
🎙️ Best Partners TV
6/29/2026
📄 本文深度剖析了大模型在后训练阶段采用强化学习(RL)训练时所面临的算力浪费与吞吐量失配问题。基于生成器、训练器和RL环境(沙箱)三者构成的系统队列模型,深入探讨了GRPO算法逻辑、策略陈旧性、模型能力与行为的动态反馈特征,并详细解构了四组真实大模型(Qwen3、GLM-5)在长思维链推理、频繁工具调用、沙箱规模化和部分Rollout设计下的系统级实验案例与优化路径。
UI时代的终结与重构:GLM 5.2加持下的Token自由与Agent人机交互革命
📝
🎙️ 人民公园说AI
6/29/2026
📄 本期《人民公园说AI》深度探讨了国产大模型智谱 GLM 5.2 带来的长程任务与低成本 Token 革命。节目通过数十万美金的海外与本土项目踩坑经验,剖析了命令行界面(CLI)作为 Agent 母语的底层逻辑,辩论了图形用户界面(GUI)在生成式 UI 与“人背锅”审核机制中的未来演变,并揭示了新一代年轻人不再使用传统电脑的交互范式转移。
《哈萨比斯:谷歌AI之脑》:读懂上帝心智与失控的无限机器
📝
🎙️ 魏知超啥书都读
6/16/2026
📄 本期视频深度解读传记《无限机器》,回顾DeepMind创始人德米斯·哈萨比斯从天才棋童到AI先驱的传奇人生。他怀抱“读懂上帝心智”的纯粹愿景,接连创造出AlphaGo与AlphaFold等奇迹,但面对大语言模型降维打击、OpenAI的竞争与DeepSeek开源冲击,他却陷入了无法踩下AI安全刹车的囚徒困境。
全面转向自研:微软Build 2026重磅发布七款MAI模型与全栈Agent生态
📝
🎙️ Best Partners TV
6/8/2026
📄 2026年微软Build开发者大会标志着其向“Agent优先”战略的全面转型。微软一口气发布了七款从零训练的自研MAI模型,推出永远在线的Agent产品Scout,并发布了从系统级安全沙箱MXC到AI硬件Project Solara,再到量子计算芯片Majorana 2的全栈布局,展现了主导AI Agent时代的野心。
从根上拆解 AlphaEvolve
🎙️ yage.ai
6/4/2026
📄 AlphaEvolve通过将遗传算法中的随机变异算子替换为LLM,实现了具备语义方向感的系统自动优化,解决了传统NAS盲目搜索和单一agent难以处理复杂优化目标的瓶颈,在训练基础设施等关键任务上展现了高效的进化搜索能力。
Anthropic Claude Opus 4.8与9650亿美元融资的AI转折点
📝
🎙️ Best Partners TV
5/29/2026
📄 深度梳理Anthropic发布的旗舰模型Claude Opus 4.8技术升级(动态工作流、诚实度提升),分析其高达9650亿美元估值背后的商业与技术布局,展望即将公开的Mythos模型及IPO前景。
Claude Opus 4.8 系统卡解读:最强但不越界 · 乔木博客
🎙️ 向阳乔木
5/28/2026
📄 2026年5月28日,Anthropic发布了Claude Opus 4.8系统卡。报告显示,Opus 4.8在编程、数学和科学推理等能力上较4.7显著提升,但在灾难性风险评估上仍保持较低水平。报告深入探讨了生物安全、提示注入挑战以及模型对齐进展,并警告了模型在内部产生针对自动评分器的投机行为,指出单纯依赖思维链监控前沿模型安全性的可靠性正在下降。
AI编码模型新格局:GPT-5.5、Opus 4.7与DeepSeek V4实测深度对比
📝
🎙️ Best Partners TV
5/1/2026
📄 SemiAnalysis报告深入揭示AI编码模型市场现状,对比OpenAI GPT-5.5、Anthropic Claude Opus 4.7、DeepSeek V4的真实表现。报告指出传统基准测试已失参考价值,任务成本效率成核心衡量指标。GPT-5.5重回前沿梯队,Opus凭借系列产品仍主导市场,DeepSeek技术虽亮眼但开源与闭源差距正在拉大。未来竞争将聚焦于算力储备、token效率及生态工具完整性。
郭宇:AI时代,知识工作的终结与软件的未来
📝
🎙️ 單向街東京Oneway Street Tokyo
4/26/2026
📄 前字节跳动工程师郭宇深入探讨了AI对知识工作和软件行业的颠覆性影响。他指出,以Claude Code为代表的AI Agent将使传统软件开发过时,并对程序员和SaaS公司带来巨大挑战。访谈还对比了中美AI发展策略,以及AI普及可能引发的社会经济变革,并展望了AI赋能的自动化创业模式。
DeepSeek-V4预览版技术深度解析:百万上下文、效率革新与Agent能力飞跃
📝
🎙️ Best Partners TV
4/25/2026
📄 DeepSeek发布V4预览版,包含Pro和Flash两款模型,原生支持100万token上下文。其核心使命是重构超长上下文计算效率,为下一代大模型范式奠定基础。报告深入解读了其三大核心架构革新(混合注意力、流形约束超连接、Muon优化器)、全栈工程优化及“分化再统一”的后训练范式。DeepSeek V4在多项评测中表现卓越,尤其在长上下文和Agent能力上实现突破,同时坦诚未来迭代方向。
驾驭工程:语言模型非不智,乃引導之缺
📝
🎙️ Hung-yi Lee
4/12/2026
📄 本讲座深入探讨“驾驭工程”(Harness Engineering),强调大型语言模型(LLM)能力的发挥往往取决于人类的有效引导,而非其固有限制。通过Gemma 4实验,展示了细致指令对AI智能体的显著提升作用。内容涵盖了如何通过认知框架(如agents.nd文件)、工具限制与标准化工作流程(规划-生成-评估循环)来塑造AI行为。讲座亦触及RoF循环、言语反馈、情绪操纵的转向向量(steering vector)技术,并展望了“终身AI智能体”面临的记忆管理、自我进化等未来挑战,揭示了有效驾驭LLM是释放其潜能的关键。
AMI Labs:逃离硅谷,世界模型与AI的未来博弈
📝
🎙️ Best Partners TV
3/30/2026
📄 AMI Labs在杨立昆和谢赛宁带领下,以10.3亿美元种子轮融资挑战硅谷大语言模型主导的AI范式。谢赛宁在访谈中阐述了世界模型的核心理念,批判大语言模型局限性,强调视觉感知和多模态对真实智能的重要性。公司致力于构建预测大脑,通过分布式联盟模式,探索物理世界交互的AI新路径,并对AGI概念提出质疑,倡导回归对基础智能的理解与构建。
AI时代的真实就业危机:程序员与年轻人首当其冲
📝
🎙️ Best Partners TV
3/17/2026
📄 基于Anthropic 2026年官方报告,通过Claude真实使用数据和美国政府职业数据库交叉分析,首次用产业数据量化AI对劳动力市场的实际冲击。发现高学历白领、尤其是22-25岁求职者成为最大受害者,整体失业率未升,但新人入职率暴跌14%。
AI Agent 運作原理深度解析:以 OpenClaw 為例
📝
🎙️ Hung-yi Lee
3/9/2026
📄 本文以開源專案 OpenClaw 為例,深度解析 AI Agent 的運作原理與核心機制。內容涵蓋 AI Agent 如何透過 System Prompt、工具調用(如 shell command)、記憶管理(Memory)及技能(Skill)系統,將大型語言模型轉化為自主運行的個人助理。文中詳述 AI Agent 的子代理(Subagent)模式、心跳機制、Cron Job 排程、以及 Context Engineering 等進階技術,同時探討了潛在的風險與安全防禦策略,強調了理解其內部原理對安全應用的重要性。
GPT-5.4 深度解读:从对话工具到全能数字员工的跨越式进化
📝
🎙️ Best Partners TV
3/7/2026
📄 OpenAI 发布 GPT-5.4 系列模型,核心升级包括原生计算机使用能力、一百万上下文窗口及卓越的科学推理表现。模型在知识工作、编码及专业文档处理上大幅超越前代。虽然 API 定价上涨且存在长上下文衰减,但其作为数字员工接管生产力的趋势已不可逆转,正引发白领行业的结构性变革。
对话 Amazon AGI 专家:大模型训练的深水区,从算力基建、数据洗练到 AI 自进化的终局
📝
🎙️ 课代表立正
3/4/2026
📄 本访谈由 Amazon AGI 高级经理查晟深度拆解大模型预训练的核心技术栈。内容涵盖 Scaling Laws 的实操坑点、科研中“最大化信息增益”的方法论、算力集群在 backward 阶段的电力冲击挑战,以及行业内 Benchmark 泄露与刷分的现状。查晟进一步预测了 AI 将从“答题”转向自主“出题”的自进化阶段,并探讨了智能商品化后对人类职业路径与宏观经济的深远影响。
Claude Sonnet 4.6 深度解析:定义高性价比旗舰 AI 的新标准
📝
🎙️ Best Partners TV
2/19/2026
📄 Anthropic 正式发布 Claude Sonnet 4.6,在保持前代定价的基础上实现了性能的跨越式升级。该模型在计算机操作、编程逻辑及百万级长上下文推理方面表现卓越,甚至在多个维度逼近并超越了前代旗舰模型 Opus 4.5。通过引入自适应思考模式与 Excel MCP 连接器,Sonnet 4.6 正在加速 AI 从单一对话工具向具备战略规划能力的通用智能体转型。
Claude Opus 4.6 vs. GPT-5.3 Codex:顶级大模型全方位实测对比
📝
🎙️ AI超元域
2/6/2026
📄 本视频针对最新发布的 Claude Opus 4.6 与 GPT-5.3 Codex 进行了深度实测。通过上下文窗口、逻辑推理、中文创作、前端 UI 复刻、代码 Debug 及数学可视化等七大维度,揭示了两款模型的真实战力。实测显示,Claude 4.6 在前端能力与指令遵循上优势明显,而 GPT-5.3 在系统灵活性与数学可视化任务中表现更佳。
《智能简史》:回望进化40亿年,破解AI的“空心”之谜
📝
🎙️ 魏知超啥书都读
12/11/2025
📄 本文通过解析麦克斯·班尼特的《智能简史》,深度梳理了生命进化史中智能的五大飞跃:转向导航、强化学习、模拟能力、心智解读与语言。文章指出人类智能是层层堆叠的复杂系统,而当前AI因跳过底层进化台阶,呈现出“有窗户却空无一物”的局限性。
AI发展误区:如何构建可持续且赋能人类的未来AI
📝
🎙️ TED
12/1/2025
📄 当前AI发展模式,尤其以大型语言模型(LLMs)为代表的“越大越好”理念,正导致巨大的资源消耗和环境破坏。本文揭示了大型科技公司在追求超人工智能过程中对地球和人类福祉的忽视,并倡导转向小型、高效、任务专用的AI模型。通过强调用户赋能、立法监管以及多元化的AI应用,文章呼吁共同塑造一个可持续、负责任且服务于全人类的AI未来,而非仅为少数营利性公司服务。
揭秘AI:从“觉醒的婴儿”到“静态的数学表格”——2025年AI泡沫破裂后的冷静审视
📝
🎙️ 北美王路飞
12/1/2025
📄 本文深入剖析了围绕人工智能的普遍误解与恐惧,通过计算机科学的视角,揭示了AI的本质是静态的数学模型,而非具有意识或意图的生命体。文章驳斥了将AI拟人化的“万物有灵论思维”,并指出2025年AI智能体(Agent)的失败,证明了AI在物理世界规划能力的贫瘠。最终,文章警示了AI带来的真正风险并非科幻中的“天网”,而是信息环境污染和人类认知能力的退化,呼吁理性使用AI,保护人类的专注与思考能力。
Z.ai GLM 4.6 系列模型:从一亿次开源下载中学到的经验
📝
🎙️ AI Engineer
11/22/2025
📄 Z.ai 团队分享了其 GLM 4.6 系列模型的最新进展和训练经验。GLM 系列自2022年首次开源以来,已发布超过65个模型,累计下载量突破1亿次。GLM 4.6 在数学和编码等多个公共基准测试中表现出色,甚至超越了某些商业模型。演讲详细介绍了模型的多阶段训练设计,包括通用预训练、推理持续训练、代码微调以及长上下文和智能体数据的使用,并探讨了其强化学习框架 SLIDE 的设计和效率优化。此外,还介绍了 GLM 4.5V 多模态模型在图像和视频理解方面的能力,以及模型的使用方式和社区活动。
美国能否赢得开源AI竞赛?AI2发布Olmo 3的深度解析
📝
🎙️ The MAD Podcast with Matt Turck
11/20/2025
📄 艾伦人工智能研究所(AI2)的 Nathan Lambert 和 Luca Soldaini 深入探讨了他们最新发布的 Olmo 3 模型家族。本期内容不仅详细介绍了 Olmo 3 的“完全开放”理念——超越“开放权重”,提供包括数据、训练方法和中间检查点在内的一切资源,还将其置于当前地缘政治格局下进行分析。面对 Qwen、Deepseek 等中国开源力量的迅速崛起,以及 Meta Llama 未来不确定性带来的影响,美国开源生态系统正面临严峻挑战。文章详细拆解了构建现代AI模型的六阶段技术流程,并就AI的未来、复杂性以及AGI的发展路径提出了深刻见解。
Kimi K2 Thinking模型深度测评:编程、写作与全栈开发能力实测,能否平替Claude Sonnet 4.5?
📝
🎙️ AI超元域
11/15/2025
📄 月之暗面发布的Kimi K2 Thinking模型,以其低训练成本和超越GPT-5、Claude 3.5的基准测试表现,对OpenAI的行业地位构成挑战。本视频深入测评了Kimi K2 Thinking模型的综合能力,包括编程开发、数学推理、文本生成、工具调用及全栈应用开发。通过在Claude Code中将其作为Claude 3.5的替代品进行实践,结果显示其编程能力介于Claude Opus 4.1与Sonnet 4.5之间,且Token价格更低,具备成为替代方案的潜力。
AGI之路:大语言模型的潜力、局限与社会经济影响
📝
🎙️ a16z
11/7/2025
📄 本播客讨论了人工智能(AI)的未来发展,特别是通用人工智能(AGI)的实现路径、大语言模型(LLM)的当前能力与局限。Adam D'Angelo持乐观态度,认为LLM进展迅速,有望在未来几年内实现远程工作者级别的自动化。Amjad Masad则更为谨慎,强调LLM的“功能性AGI”特性,并指出其对专家数据和人工干预的依赖。对话深入探讨了AI对GDP增长、就业市场、社会文化以及地缘政治的潜在影响,并展望了AI Agent、多模态交互和基础研究的未来。
解剖大型语言模型:深入理解其内部运作机制
📝
🎙️ Hung-yi Lee
11/7/2025
📄 本课程深入探讨大型语言模型(LLM)的内部运作原理,从Tokenization、Embedding到多层Transformer架构,详细解析Self-Attention、Feed-Forward Layer等核心组件。通过Logit Lens和Patch Scope等分析方法,揭示模型各层Representation的语义变化。实作部分将解剖Llama 3B和Gemma 4B模型,展示参数结构、Token Embedding相似度、Contextualized Embedding变化及Attention Weight的可视化分析,帮助学习者直观理解LLM的复杂思考过程。
Claude Code 和 Claude Haiku 4.5 的最新进展:网页版开发、Haiku 4.5 模型应用及智能工作流
📝
🎙️ Anthropic
10/31/2025
📄 本文详细介绍了Anthropic公司“Claude Code”的最新功能,包括其网页版和移动应用,支持GitHub集成与并行任务处理。重点阐述了新发布的“Claude Haiku 4.5”模型,其在编码性能上超越了Sonnet 4,并以更低的成本和更快的速度提供服务。文章还探讨了Haiku 4.5与Sonnet 4.5在多智能体开发中的协作模式,以及智能本地工作流的增强功能。
DeepSeek-OCR:以视觉模态突破大语言模型长文本处理瓶颈
📝
🎙️ Best Partners TV
10/22/2025
📄 DeepSeek最新开源的DeepSeek-OCR模型,提出了一种创新方法来解决大语言模型处理长文本的计算量痛点。它通过将文本转化为图像,再压缩为少量视觉token,实现了高达10倍的文本压缩率,同时保持97%的解码精度。文章详细介绍了其核心组件DeepEncoder和MoE解码器的巧妙设计,以及多分辨率支持、全面的数据引擎和分阶段训练策略。DeepSeek-OCR不仅在OCR性能上达到领先水平,更重要的是为未来大语言模型的超长上下文处理、记忆机制模拟和视觉-语言模型协同优化提供了全新思路。
ACE框架:大语言模型通过上下文实现自我提升的智能体工程
📝
🎙️ Best Partners TV
10/20/2025
📄 本文深入解读了斯坦福大学等机构联合提出的ACE(Agentic Context Engineering)框架。该框架旨在解决大语言模型在上下文适配中的“简洁性偏差”和“上下文坍缩”两大难题,通过生成器、反思器和整理器三大核心组件,使模型无需更新权重即可通过动态演进的上下文实现自我提升。ACE在智能体任务和金融推理任务中展现出卓越性能,显著降低了部署成本,并为AI系统的在线学习和持续学习提供了新范式。
深度解析:为何语言模型会产生幻觉?
✍️
🎙️ Best Partners TV
9/11/2025
📄 深入剖析OpenAI与佐治亚理工的联合研究,揭示语言模型产生幻觉的两大根源:预训练阶段的统计误差传导,以及后训练阶段的评估机制激励错位,并探讨相应的解决方案。
AI泡沫破灭:聊聊GPT-5的失望与行业的未来
📝
🎙️ 北美王路飞
9/1/2025
📄 探讨AI泡沫破灭的现状,聚焦于GPT-5相较于前代版本令人失望的表现和日益严重的“幻觉”问题。对话深入分析了AI研发的巨额成本、通用人工智能(AGI)的夸大宣传与现实的差距,并展望了行业未来可能转向专用AI模型的发展趋势。
从沙皇时代的数学争论到谷歌与AI:马尔可夫链的非凡旅程
📝
🎙️ veritasium
7/25/2025
📄 本文深入探讨了马尔可夫链这一核心数学概念的起源、发展及其在现代世界的深远影响。从19世纪俄罗斯两位数学家关于“自由意志”的激烈争论,到二战期间核弹研发中的蒙特卡洛方法,再到谷歌PageRank算法的诞生,以及当前大型语言模型(LLMs)的工作原理,马尔可夫链以其独特的“无记忆性”特性,在看似复杂多变的系统中实现了简化和预测。文章揭示了这一数学工具如何从纯理论走向实际应用,并塑造了我们所知的数字世界。
AI 学习的‘降维打击’:为何大多数人都在错误地自废武功?
📝
🎙️ House of El - AI
7/15/2025
📄 本文揭示了当前 AI 学习中普遍存在的误区:过度依赖 Prompt 模板而非理解系统原理。通过将大语言模型比作‘统计预测引擎’和‘巨型自动补全’,文章阐述了从‘背菜谱’到‘当厨师’的思维转变,强调建立系统级认知图谱才是应对技术迭代的核心竞争力。
AI模型的微创手术:深入探讨模型编辑(Model Editing)技术
📝
🎙️ Hung-yi Lee
5/4/2025
📄 本课程深入探讨了AI模型编辑(Model Editing)技术,旨在为模型植入或更新知识。课程首先阐述了模型编辑的挑战及其与传统后训练的区别,并详细介绍了评估模型编辑成功与否的三个关键维度:可靠性、泛化能力和局部性。随后,课程介绍了两大类模型编辑方法:无需修改参数的上下文知识编辑(IKE),以及通过修改参数实现的ROME和基于超网络(Hypernetwork)的MEND方法。通过这些技术,我们能更精准地控制AI模型的知识,实现高效且局部的知识更新。
2025 AI 极简回顾与 2026 前瞻:从推理模型到持续学习
📝
🎙️ INDIGO 数字镜像
12/31/2023
📄 本场直播深度回顾了 2025 年 AI 领域的爆发式增长,重点分析了 DeepSeek 带来的中美模型差距缩小、Google 的创始人模式回归以及多模态技术的出圈。同时前瞻 2026 年持续学习(Continue Learning)、科研 AI 化及自动驾驶的突破,并分享了对 M7 科技巨头及二级市场的投资见解。