重构人机协作:Thinking Machines Lab 发布原生交互模型 Interaction Models Best Partners TV 2026-05-13

语义带宽:重构协作的底层逻辑

2026年5月11日,由前 OpenAI 首席技术官 Mira Murati(米拉·穆拉蒂)创立的 Thinking Machines Lab 发布了其最新研究成果:交互模型(Interaction Models)。这项研究试图重构人机协作的底层逻辑,将交互从模型的一项“附加功能”转变为其“原生基因”。目前大模型虽然智能极强,但在协作方式上仍处于极其笨拙的阶段,人类习惯于“发邮件式”的轮询交互——即必须等用户输入完成、模型思考、生成输出后,才能进行下一轮沟通。这种模式缺乏即时反馈、无法打断,更没有像人与人面对面那样边说边听、边看边回应的自然感。

Thinking Machines Lab 指出,全球顶尖 AI 实验室正陷入一个认知误区:将 AI 自主完成长时任务的能力作为核心评价标准,这导致主流大模型完全没有为人类持续的 In-the-loop(人在回路:人类参与决策与调整的闭环过程)做优化。在真实场景中,没有人能一次性说清所有需求,优质成果需要人类全程参与、不断澄清与反馈。然而,现有的交互界面并没有给人类留下参与的空间,导致模型的响应在同步协作中显得极其迟缓。

沟通基础:从单线程轮询到实时共存

为了解决这一问题,研究团队引用了克拉克(Clark)和布伦南(Brennan)在1991年《沟通基础》(Grounding in Communication: 关于沟通如何建立共识的经典理论)中提出的三大核心要素:共存性(双方互动同一对象)、即时性(信息产生即被接收)和同步性(双方同时输入输出)。此外,瓦尔特·J·翁诗杰(W.J. Ong)在《口语和书面语》中也提到,口头交流的魅力在于其参与性。

当前的通用大模型完全背离了这一逻辑。它们采用单线程感知,在用户输入时模型处于冻结等待状态,而模型生成时则对外部新信息视而不见。这种设计阻断了哈耶克(F.A. Hayek)所说的基于特定时点的“隐性知识”以及斯科特(James Campbell Scott)提到的依赖直觉的“实践智慧”(Metis: 基于经验和随机推理的智慧)。为了打破协作带宽瓶颈,AI 必须适配人类的协作习惯,实现在所有模态下的实时交互,而非强迫人类去适配 AI 的轮询规则。

原生进化:摆脱“外部脚手架”的束缚

目前市面上的实时语音 AI 多是靠外部组件“拼接”出来的,例如使用 语音活动检测(VAD: Voice Activity Detection)判断停顿,或用多模块组合模拟打断。Thinking Machines Lab 引用萨顿(Sutton)在《苦涩的教训》(The Bitter Lesson: 指出利用算力的通用方法最终会战胜人工设计的规则)中的观点,认为手工定制的系统终将被通用能力超越。因此,交互必须成为模型本身的一部分。

交互模型解锁了五大原生核心能力:

  1. 无缝对话管理:模型能隐性感知说话人是在思考、自我纠正还是邀请回应,无需人工设定轮询边界。
  2. 主动插话:模型能根据视觉和语音上下文随时介入,例如实时纠正用户的口误。
  3. 全双工同步交互:支持双方同时说话,典型场景如实时同声传译。
  4. 原生时间感知:模型自带时间流逝感知,无需外部计时器即可执行“每4秒提醒我呼吸”等指令。
  5. 并发工具调用与生成式 UI:模型在对话的同时,可并发执行搜索、调用工具并实时更新 UI 界面,无需中断沟通。

微轮询架构:时间对齐的技术突破

在技术实现上,交互模型彻底颠覆了传统“Token 序列”的线性逻辑。它采用了时间对齐的微轮询设计(Time-aligned Micro-polling),以真实时间为基准,将连续的流拆分为无数个 200毫秒 的微单元。在每个单元内,模型同时处理输入并生成输出,使沉默、语音重叠和打断都成为上下文的一部分。

为了平衡响应速度与深度推理,系统采用了双模型协同架构

  • 实时交互模型(Front-end):负责持续双向交互,处理即时响应与上下文承接。
  • 异步后台模型(Back-end):负责深度推理、长时规划与复杂工具调用。 当交互模型遇到复杂任务时,会将上下文打包给后台模型,后者处理完后流式返回,由交互模型在合适时机自然融入对话。这种架构让用户同时拥有“快速反应”与“深度思考”能力,且交互模型本身的智能水平在行业内也极具竞争力。

极简融合与推理优化:性能的极限压榨

为了降低延迟,研究团队开发了无编码器的早期融合(Early Fusion)技术。不同于传统多模态模型分离的音频/视频编码器,交互模型通过轻量嵌入层和 hMLP 编码将特征直接输入 Transformer,大幅提升了信息融合效率。针对 200ms 微轮询带来的高频小批量预填充挑战,团队实现了流式会话机制,并将该功能贡献给了开源项目 SGLang。同时,他们在 混合专家模型(MoE)中优化了计算内核,并实现了比特级的训练器与采样器对齐,确保系统极度稳定。

在安全防御上,团队从模态适配的拒绝响应长时健壮性两个维度发力,通过自动化红队测试,保证了语音与文本交互在违规场景下拒绝行为的高度一致性。

性能领跑:TML-Interaction-Small 实力霸榜

在基准测试中,TML-Interaction-Small(2760亿参数 MoE,激活参数120亿)展现了统治级的性能:

  • 响应延迟:轮询延迟仅为 0.40秒,远低于 GPT-realtime-2.0 的 1.18秒和 Gemini-3.1-flash-live 的 0.57秒。
  • 交互质量:在 FD-bench v1.5 流式基准中获得 77.8分,大幅领先竞品。
  • 时间与视觉感知:在 TimeSpeak(定时发起语音)和 ProactiveVideoQA(主动视觉回答)等新维度基准上,现有商业 API 几乎无法得分,而交互模型能有效完成任务。

尽管在长会话上下文管理、网络依赖性以及大规模模型部署上仍存挑战,Thinking Machines Lab 已计划在 2026 年内发布更大规模的模型。该研究预览版将在未来几个月限时开放,并于 2026 年下半年全面发布,预示着 AI 将从一个“被动执行工具”进化为真正的“实时协作伙伴”。

关键字: interaction-models human-computer-collaboration real-time-ai dual-model-architecture low-latency-inference