标签:ai-inference
-
OpenAI首款自研推理芯片Jalapeño深度解析:软硬件协同设计如何重塑AI算力版图与动摇CUDA生态
📝
🎙️ Best Partners TV
📄 本文深度解析了OpenAI在Hot Chips大会上公布的首款自研通用AI推理芯片Jalapeño(墨西哥辣椒)。该芯片由OpenAI与博通合作,历时16个月完成从立项到流片,在每兆瓦Token吞吐能效比上击败了英伟达Vera Rubin等竞品。文章从能效瓶颈、统一计算架构决策、芯片硬件规格、Gluon编译语言与AI辅助设计等维度,系统性剖析了这款芯片对传统半导体研发范式及CUDA生态的颠覆性影响。 -
停止租用认知基础设施:何时走向AI推理自建之路?
📝
🎙️ AI Engineer
📄 本文探讨了在生成式 AI 推理费用暴涨的背景下,企业所面临的成本与技术主权痛点。通过对 Uber、大型零售商及作者自身项目的案例分析,指出了租用 API 模式在成本控制、安全性及合规性上的局限,并提出了“租用以学习,拥有以收益”的自建基础设施抉择模型。 -
算力战争的终局:AI推理市场将超越石油与太空数据中心的崛起
📝
🎙️ Best Partners TV
📄 本篇整理自SemiAnalysis创始人迪伦·帕特尔的深度专访。他指出未来AI推理市场规模将超越石油行业,并从个人硬件启蒙聊到算力经济、软硬协同设计、内存与功耗瓶颈、GPU与TPU之争以及太空算力的终局图景。 -
算力市场深探:从成本冲击到AI基础设施金融化
📝
🎙️ Bloomberg Podcasts
📄 本期播客探讨了激增的AI推理需求如何引发企业的预算焦虑与模型路由需求。CoreWeave联合创始人解析了算力客户结构向华尔街等企业的扩散、长达五年的基础设施锁定合约、Nvidia在推理端的持续垄断,以及通过特殊目的实体(SPV)实现数据中心非追索性融资的创新模式。同时指出,由于模型浮点运算利用率(MFU)等性能差异,算力在短期内难以成为标准大宗商品。 -
巨型芯片的豪赌:Cerebras CEO 揭秘为何要制造“餐盘大小”的晶圆级处理器
📝
🎙️ Bloomberg Podcasts
📄 本期访谈对话 Cerebras 创始人 Andrew Feldman,深入探讨了其独特的“晶圆级引擎”(WSE)架构如何通过物理规模解决 AI 推理中的存储瓶颈。Andrew 详细解释了巨型芯片在速度、能效及成本上的代际优势,并分析了推理市场的爆发、CUDA 护城河的消解、以及 AI 硬件行业在供应链和政治环境下的长期挑战。 -
快速模型需要“慢”开发者:AI 时代的开发策略重构
📝
🎙️ AI Engineer
📄 随着编码模型推理速度实现 20 倍的质的飞跃(如 Codex Spark 达到 1200 token/s),开发者必须从追求‘一次生成、大规模并行’的坏习惯转向实时的‘人机协作’。本文通过硬件层、架构层到开发实践的深度拆解,提出了一个实操手册:利用模型速度优势实现代码验证与自动化重构的零成本化,并强调了在模型生成速度超过人类认知速度时,保持代码质量、 steer 能力以及精确的上下文管理的重要性。 -
DeepSeek新论文:让AI像人一样“用手指着图片思考” · 乔木博客
🎙️ 向阳乔木
📄 DeepSeek团队提出了一种新颖的多模态AI推理框架,通过让模型像人一样‘用手指着图片’进行思考,利用视觉原语(点和框)来增强空间、计数和拓扑推理能力。该框架在视觉Token用量显著减少的情况下,性能媲美甚至超越了GPT-5.4、Claude-Sonnet-4.6和Gemini-3-Flash等领先模型,有效解决了当前多模态模型在精确空间指代上的‘参考鸿沟’问题。 -
开源模型推理采购指南:GLM-5.1、DeepSeek V4 Pro、Kimi
K2.6 的 API、订阅和 Ollama Cloud 对比
🎙️ yage.ai
📄 本文对比了 GLM-5.1、DeepSeek V4 Pro 和 Kimi K2.6 这三款开源模型的推理服务。从价格、隐私和速度三个维度,分析了 DeepSeek、z.ai、Kimi 和 Ollama Cloud 等厂商的 API 按量计费与订阅方案,详细对比了不同用量和数据敏感度下的成本与政策。文章还讨论了速度和限流情况,并为不同场景下的模型选型提供了具体建议。 -
Cerebras Systems:颠覆AI算力格局的晶圆级芯片巨头IPO之路
📝
🎙️ Best Partners TV
📄 本视频深入解析了Cerebras Systems的创业历程、颠覆性技术(晶圆级芯片)及其商业逻辑。公司通过超越NVIDIA的推理速度和创新的良率解决方案,成功实现盈利并获得OpenAI、AWS等巨头的大规模合作,已提交IPO申请,估值飙升至230亿美元,预示着AI推理芯片市场正迎来多技术路线的激烈竞争,并可能重塑行业格局。 -
AI自我修正的奥秘:从推理到工作流再到模型参数的进化之路
📝
🎙️ Hung-yi Lee
📄 本课程深入探讨了大型语言模型的自我修正能力。首先从推理阶段的Contrastive Decoding技术入手,介绍其通过生成错误答案并与正常答案对比进行修正的原理及Dora、CAD等多种变体。接着分析了基于工作流的“生成加验证”模式,对比了内部反思与外部反馈的效果及其算力成本。最后探讨了通过强化学习直接修改模型参数以提升推理能力,并讨论了RL究竟是激发了模型固有能力还是赋予了新能力的哲学与技术争议。 -
软件股逆势突围与博通 AI 推理潮:探寻滚动熊市下的成长股底背离
📝
🎙️ 投资TALK君
📄 本文深度解析美股当前成长股与价值股的轮动逻辑,指出软件板块(IGV)在指数下跌中展现出的逆势强势,预示着空头平仓与阶段性底部。通过分析 Costco 财报,观察到通胀小幅回落及潜在关税退税利好;同时重点解读博通财报揭示的 AI 推理强劲需求,认为博通与英伟达当前估值均具吸引力,建议关注自研芯片趋势下的资产配置。 -
Dylan Patel:英伟达的新护城河与中国半导体雄心
📝
🎙️ The MAD Podcast with Matt Turck
📄 本期访谈中,半导体分析师**Dylan Patel**深入探讨了**英伟达**通过收购**Grock**等策略构建多架构芯片护城河,以应对AI模型快速演进的挑战。他分析了中美在AI和半导体领域的激烈地缘政治竞争,**中国**本土半导体产业的崛起,以及**美国芯片法案**的局限性。此外,Patel还驳斥了AI对电网和水资源造成巨大压力的误解,并强调AI模型在软件和生产力方面带来的巨大变革,认为AI的经济价值远被低估。 -
【商业】英伟达200亿天价拿下Groq | 低延迟 LPU | AI推理算力革命 | 英伟达补短板 | 全球AI能源博弈 | 芯片行业变局 | AI 劳动力短缺 | HBM供应链护城河
📝
🎙️ Best Partners TV
📄 本次视频深入分析了英伟达以200亿美元收购AI芯片初创公司Groq的重磅交易。交易核心在于Groq专为AI推理设计的低延迟、高能效LPU技术,旨在弥补英伟达在推理算力上的结构性短板。通过对Groq创始人Jonathan Ross的访谈回顾,文章揭示了AI算力瓶颈、速度对用户参与度的影响、HBM供应链的关键作用,以及AI对未来经济(通缩、劳动力短缺)的深远预测。此次收购标志着AI产业正从训练转向规模化推理落地。