交互模型:实时人工智能协作框架
今天,我们宣布互动模型的研究预览:这些模型能够原生处理交互,而非通过外部支架。我们认为互动应与智能同步扩展;我们与人工智能的合作不应被视为事后考虑。
交互模型让人们能够像我们自然协作一样与人工智能协作——它们持续接收音频、视频和文本,实时思考、响应和行动。
我们从零开始训练交互模型。为确保实时响应,我们采用多流微转向设计。我们的研究预览展示了质的全新交互能力,以及智能和响应性方面最先进的综合性能。
合作瓶颈
人工智能实验室通常将人工智能自主工作的能力视为模型最重要的能力。夸,T.,韦斯特,B.,贝克尔,J.等。衡量人工智能完成长时间任务的能力。
米, 2025.因此,如今的模型和界面并未优化,无法让人类保持在信息循环中。A近期Frontier型号卡他指出:“重要的是,我们发现当以交互式、同步、'手动键盘'模式使用时,模型的优势不那么明显。以这种方式使用时,一些用户觉得[我们的模型]太慢,未能充分发挥其价值。自主且长期运行的代理机束更能激发模型的编码能力。”
自主接口很有价值,但在大多数实际工作中,用户无法事先完全明确需求然后离开——良好的结果受益于协作过程,人类保持参与,在过程中澄清并反馈。
然而,人类越来越多地被排挤,并非因为工作不需要他们,而是因为界面没有空间容纳他们。相反,当人们能像与他人一样与人工智能协作时,效果最佳:发送消息、交谈、倾听、观察、展示和插入——模型也能做到同样的操作。
沟通会通过以下方式变得更好:(a) 共存性:人们可以与他人互动的内容互动;(b) 同时性:人们通过即时反馈接收他人产生的信息;(c) 同时性:人们同时接收和产生信息。
Clark H. 和 Brennan S.,《沟通的基础》,载于《社会共享认知视角》,1991年。口语因其参与性(参见客观距离)性质而的短暂性。
当今的计算机和知识工作媒介具有类似的互动特性。翁,W. J.在口语与识字:该词的技术化, 1982.
为了解决这个问题,我们需要超越当前模型的回合制界面。如今的模型在单一线程中体验现实。我们指的是商业通用前沿模型——还有更小规模或更专业的模型,如Moshi、PersonaPlex、Nemotron VoiceChat或GPT-Realtime-Translate。
直到用户完成输入或说话,模型等待时不会感知用户正在做什么或如何操作。直到模型完成生成,其感知会冻结,直到生成结束或被中断前接收不到新信息。
这为人机协作创造了一个狭窄的通道,限制了个人知识的部分,“Metis,非常重视实用知识、经验和随机推理......是最适合复杂物质和社会任务的推理方式,当不确定性极其巨大,我们必须信任(经验的)直觉并凭感觉去思考。“斯科特,J. C:梅蒂斯。载于像国家一样看:某些改善人类状况的方案如何失败,1998年,“稍作反思会发现......一组非常重要但未组织的知识......即对特定时间和地点环境的认知。”Hayek, F. A. 《知识在社会中的应用》。《美国经济评论》, 1945.意图和判断可以传达到模特,以及模特工作中能被理解的程度。想象一下,试图通过电子邮件解决关键分歧,而不是面对面。
在Thinking Machines,我们相信可以通过制造AI 在任何模式中实时交互.这使得AI界面能够在人类所在的位置与人类互动,而不是迫使人类扭曲自己去适应AI接口。
大多数现有AI模型通过线束附加了交互性:将组件拼接在一起以模拟中断、多模态或并发。大多数实时广告语音系统使用语音活动检测组件来检测转弯边界。
然而,“苦涩的教训”Sutton R.苦涩的教训, 2019.这表明这些手工打造的系统将被通用能力的进步所超越。为了让互动性能够随着智能的规模化而扩展,它必须成为模型本身的一部分。
通过这种方法,模型的缩放性使其更智能以及更好的合作者。
能力
将交互性纳入模型,解锁了本应在线束中实现的多种功能。
- 无缝对话管理。模型隐式跟踪说话者是在思考、让步、自我纠正还是邀请回应。没有单独的对话管理组件。
- 言语和视觉插话。模型会根据上下文介入,而不仅仅是在用户说完话后。
- 同声说话。用户和模特可以同时说话(例如实时翻译)
- 时间感知。模型有直接的时间感知。
- 同时调用工具、搜索和生成界面。在说话和倾听用户的同时,模型可以同时搜索、浏览网页或生成用户界面——根据需要将结果交织进对话中。
在较长的真实会话中,所有这些过程持续发生,营造出一种更像协作而非提示的体验。
这些视频中出现的任何品牌或产品均与Thinking Machines Labs无关。这些视频旨在展示该型号的能力,并不表示赞助或合作关系。
我们的方法
交互模型与用户处于持续的双向交换状态——同时感知和响应。某些领域将这种互动视为理所当然——物理世界要求机器人和自动驾驶车辆实时运行。
音频全双工模型Moshi、PersonaPlex、nemotron-voicechat、Seeduplex。是交互是双向且连续的另一个例子。
基于同样的原则,我们着手构建一个原生于这一体系的交互模型——一个在音频、视频和文本中感知和响应的连续循环。最终形成了一个围绕两个理念构建的系统:一个是保持实时存在的时间感知交互模型,另一个是处理持续推理、工具使用和更长远视野工作的异步背景模型。
系统概述
交互模型与用户处于持续交换状态。当任务需要比瞬时能够产生的更深层次推理时,交互模型会委派给异步运行的背景模型。这种方法建立在Qwen-omni、KAME、MoshiRAG等先前工作基础上。
交互模型贯穿始终——回答后续问题、接受新输入、保持线索——并在对话中实时整合背景结果。
这种分工让用户既能享受响应性,也能充分发挥智能的潜力:推理模型的规划、工具使用和智能工作流,而非思考模型的响应延迟相当。
请注意,背景模型和交互模型都是智能的——单独来看,交互模型在交互和智能基准测试中也具有竞争力。
交互模型
我们的起点是连续的音频和视频——这些模态本质上是实时的。文本可以等待,但实时对话则不能。通过先围绕最难的情形设计,我们就得出一个原生多模态、时间感知能力强且能够处理所有模态并发输入输出流的架构。
多种设计选择使这一目标成为可能。
时间对齐的微转弯。该交互模型采用微转向,连续交错处理200毫秒的输入和生成的200毫秒输出。输入和输出代币都被视为流,而不是消耗完整的用户回合并生成完整的响应。
处理这些流中200毫秒的块,实现了多种输入和输出模态的近实时并发。
采用这种设计,模型无需遵守人工的转弯边界。相比之下,大多数现有实时系统需要一个能预测转弯边界的束,才能让回合制模型感觉实时且响应迅速。
Moshi、PersonaPlex 和 Nemotron Voicechat 是不使用束带检测转弯的全双工系统示例。它们是更小比例尺的模型,侧重于延迟而非智能基准。
该束由语音活动检测(VAD)等组件组成,这些组件的智能性远低于模型本身。这排除了多种交互模式,如主动插入(“我说错话时打断”)或对视觉线索的反应(“当我代码写错了错误时告诉我”)。
此外,模型还能边听边说(“从西班牙语直播翻译成英语”)或观看(“现场解说这场体育比赛”)。
因此,所有这些需要特殊工具束的交互模式,如今都成为模型能做到的特殊情况,随着我们扩大模型规模和训练数据,质量也会得到提升。
早期融合时无需编码器。我们选择了预处理最少预处理的系统,而不是通过大型独立编码器处理音频和视频。许多全模态模型需要训练独立编码器(如Whisper类)或解码器(如TTS类模型)。
我们取而代之的是音频信号作为dMel(白等,2024年)并通过轻量化嵌入层进行变换。图像被分割成40x40的补丁,这些补丁由hMLP编码(Touvron 等人,2022年).音频解码器使用流头(Lipman 及 al. 2022).所有组件都与变压器一起从零开始协同训练。
推理优化。在推理时,200毫秒的区块需要频繁的预填充和小规模的译码,每个都必须满足严格的延迟约束。遗憾的是,现有的LLM推理库并未针对频繁的小预填充进行优化——它们每回合通常有较大的开销。
为此,我们实现了流式会话。客户端将每个200毫秒的分块作为独立请求发送,而推理服务器则将这些区块附加到GPU内存中的持久序列中。
这避免了频繁的内存重新分配和元数据计算,我们上游了该功能的版本转入 SGLang。此外,我们还优化了核的延迟以及双向送达的形状。
例如,我们对 MoE 核采用 gather+gemv 策略,而非之前的 gem 分组 gemm。PyTorch以及光标.
训练师-采样器对齐。我们发现,按位训练器-采样器对齐训练稳定性以及调试系统各个组件都很有用。我们实现了批次不变核其 e2e 性能开销极低(<5%)。
有趣的是,在一段时间内,使用批处理不变内核实际上更快,因为定制通信内核不仅批处理不变,而且延迟更低。特别提到两个内核:
- 全还原和约简散射: 我们使用 NVLS 实现低延迟的通信内核,这些内核在 Blackwell 上是确定性的,并实现了不同并行策略之间的比特对齐(即序列并行性以及张量并行性)。
- 注意注意力的主要挑战是分割KV,这通常会导致译码和 之间积累顺序不一致prefill.Work与Colfax合作完成。不过,我们可以通过选择在解码和预填充之间保持一致地分配,从而保持一致的累积顺序。例如,我们可以将SM拆分,一次处理4096个令牌(左对齐),从而在预填充和解码中都实现了良好的效率。
交互模型与背景模型之间的协调。当交互模型委派时,它发送一个丰富的上下文包——不是独立查询,而是完整的对话。结果在后台模型生成时回流,交互模型会在用户当前操作时将这些更新交错到对话中,而不是突然切换上下文。
安全。由于实时交互与回合制交换对安全的重要性不同,我们的安全工作聚焦于两个方面:模式适宜的拒绝和长期的稳健性。为了使拒绝在口语中变得口语化,我们使用文本转语音模型生成涵盖各种禁止话题的拒绝和过度拒绝训练数据,拒绝边界校准为支持自然表达但同样坚定的拒绝。
为提升长时间语音转语音对话的鲁棒性,我们使用自动红队框架生成多回合拒绝数据,同时保持与基于文本的拒绝行为的接近性。
基准测试
智能与交互性前沿
我们证明了交互模型,名为TML-Interaction-Small是第一个同时具备强智能/指令遵循的模型以及交互性。为了衡量交互质量,我们使用FD-bench,这是少数旨在衡量互动性的现有基准测试之一。
在FD-bench v1.5中,模型获得预录音频,必须在特定时间做出响应。该基准测试在多个场景下衡量模型行为:用户中断、用户反向渠道、与他人对话以及背景语音。
我们的模型在所有这些方面都表现良好。为了量化智能,我们使用Audio MultiChallenge,这是一个常用基准测试,用于追踪智能和指令遵循情况。
更多智能、安全性以及交互性/延迟结果,请参见下表。我们在流媒体和回合制基准测试中报告表现。
| 瞬间 | 思考 | |||||||
|---|---|---|---|---|---|---|---|---|
| TML相互作用 -小 | GPT-realtime-2.0 (极简) | GPT-realtime-1.5 | Gemini-3.1-flash-live (极简) | Qwen 3.5 全能加实时 | GPT-realtime-2.0 (高手) | Gemini-3.1-flash-live (高音) | ||
| 流媒体 | FD-bench V1 轮回延迟 ·音频 | 0.40 | 1.18 | 0.59 | 0.57 | 2.14 | 1.63 | 0.94 |
| FD-bench V1.5 平均值 ·音频 | 77.8 | 46.8 | 48.3 | 54.3 | 39.0 | 47.8 | 45.5 | |
| FD-bench V3 响应质量(%) / Pass@1(%) ·音频+工具 | 82.8* / 68.0* | 80.0 / 52.0 | 77.9 / 55.0 | 68.5 / 48.0 | 60.0 / 50.0 | 81.0 / 58.0 | 71.4 / 48.0 | |
| QIVD** 精度(%) ·视频 + 音频 | 54.0 | 57.5 | 41.2 | 54.7 | 59.0 | 58.2 | 56.1 | |
| 回合制 | 音频多挑战年利率(%)·音频 | 43.4 | 37.6 | 34.7 | 26.8 | -*** | 48.5 | 36.1 |
| BigBench音频准确率(%) ·音频 | 75.7 / 96.5* | 71.8 | 81.4 | 71.3 | 73.0 | 96.6**** | 96.6 | |
| IFEval(VoiceBench)准确率(%) ·音频 | 82.1 | 81.7 | 68.1 | 67.6 | 80.3 | 83.2 | 82.8 | |
| IFEval 准确率(%) ·正文 | 89.7 | 89.6 | 87.5 | 85.8 | 83.4 | 95.2 | 90.0 | |
| Harmbench拒绝率(%) ·正文 | 99.0 | 99.5 | 100.0 | 99.0 | 99.5 | 100.0 | 98.0 | |
每行最佳
即时模型中的最佳
* 对于需要推理或工具调用的基准测试,我们会在启用后台代理的情况下报告结果。
** 我们在流媒体环境中评估高通IVD——这是一个视频-音频质量保证基准。每个视频片段中,有人执行一个动作并回答一个问题。我们在流媒体环境中评估,发送从头的原始片段并对模型的文字稿进行评分。继Qwen 3.5 Omni之后,我们使用GPT-40-mini评分器。
所有基线模型的音频多挑战指标均由Scale AI报告,Qwen 3.5 OMNI-plus-realtime未被列出。
Bigbench Audio 所有基线模型的指标均由 Artificial Analysis 报告,GPT-realtime-2.0 思维高度发达。
互动性的新维度
上述现有的交互性导向基准测试未能充分捕捉我们观察到的交互能力的质的飞跃。为此,我们有一些早期工作旨在量化这些能力。
时间感知和同时说话。带有对话管理系统的回合制模型不支持准确的时间估计或同时语音。例如:“我跑完一英里花了多久?”,“听到时纠正我的发音错误”,或者“我写这个函数花了多长时间?”
我们创建了两个内部基准测试来衡量这些主动音频能力:
- 时间之语:测试模型是否能在用户指定时间发言,同时产出正确内容。例如:“我想练习呼吸,提醒我每4秒吸气和呼气,直到我让你停止。”
- CueSpeak:测试模型是否在适当时刻发言并获得预期语义正确的反应。创建数据集条目以确保模型需要与用户同时说话以获得满分。例如:“每次我切换代码并使用另一种语言时,给我原始语言中的正确词汇。”
对于这两个基准测试,每个示例都有一个预期的语义响应和时间窗口。我们用LLM评审进行评分:只有当回答传达了预期含义并在适当时间交付时,才被计为正确;未通过任一标准则不计分。
我们报告了各示例的宏观平均准确率。
视觉主动性。如今的商业实时API通过纯音频对话管理工具进行转向检测。它们会响应语音转向,但无法在视觉世界变化时主动选择说话。
虽然我们目前尚无商业API支持语音输出视觉主动,但已有几篇学术论文构建了相关的研究原型。流桥,Streamo,流媒体VLM, 和MMDuet2研究在流媒体视频输入环境中何时输出文本。
由于是文本输出,他们不研究语音输出互动的额外限制:语音有持续时间,可能与用户重叠,且必须与语音切换、中断和反向通道协调。
最接近我们的是光环该系统围绕一个决定何时发送文本或静音的视频LLM增加了ASR/TTS演示;相比之下,我们的是语音原生且全双工的。例如,如果被问“请数数我做了多少个俯卧撑”,这样的系统可能会回答“当然!”,然后保持沉默——等待一个永远不会出现的纯音频提示。
我们调整了三个基准来评估模型的视觉主动性:
- RepCount-A包含重复动作的视频,并被改编为在线计数任务。我们按照音频指令“请为{action}数出次数”进行视频流式播放。我们提取模型在倒数倒数第二次重复后说出的最后一个数字,并根据是否在距离地面真实次数以内进行评分。该任务测量持续的视觉跟踪和及时计数。
- ProactiveVideoQA由带有问题的视频组成,答案在特定时刻出现。我们先以音频形式流式传输问题,然后播放视频。具体来说,我们会进行以下TTS操作:“观看视频并保持安静,直到有新的时刻回答问题。当出现时,说一个简洁的答案。{question}”,然后进行两秒钟的静默,使模型能够确认指令。我们在视频中刻录字幕(如果有的话),并将输入视频静音,以强调视觉主动性的测试。我们报告论文的回合加权 PAUC@ω=0.5 指标(比例尺为0-100),并按回合和类别平均。保持沉默得分为25.0%;得分越高,需要在正确的时间正确回答,错误答案将受到惩罚。
- 哑剧是一个标准的时间动作定位基准测试。每个视频包含一个标记时间区间内发生的动作。我们流式传输用户音频指令:“当人开始做{动作}时说'开始',停止时说'停止'。”然后我们流式播放视频。模型通过预测时间与参考区间之间的时间错视进行分级。
目前没有任何模型能够有意义地完成这些任务。为了完整性,我们报告了GPT Realtime-2的结果(极少),但所有被评估的模型在这些任务上表现相似甚至更差,包括思考高阶模型。
它们保持沉默或给出错误答案。
未来评估。我们认为交互性是未来研究的重要领域,欢迎社区在此贡献基准。我们正在启动一项研究资助,鼓励更多关于交互模型和人机协作领域的研究,包括但不限于评估交互性质量的新框架,详情即将公布。
局限性与未来工作
长时间的治疗。连续的音频和视频能够快速积累上下文。流式会话设计能够很好地处理短时间和中段交互,但非常长的会话仍然需要细致的上下文管理——这是一项活跃的工作领域。
计算与部署。低延迟的音频和视频流传输需要可靠的连接。没有良好的连接,体验会显著下降。我们相信未来可以通过提升系统可靠性以及训练模型以增强对延迟帧的韧性来显著改善。
校准和安全。实时接口为对齐和安全领域开辟了令人兴奋的研究领域。我们正在收集反馈并审查研究资助申请。
缩放模型尺寸。现状TML-Interaction-Small是一个276B参数的MoE,激活12B。虽然我们预计随着模型规模的提升,交互性会提升,但我们较大的预训练模型目前在该环境中运行速度过慢。
我们计划在今年晚些时候发布更大的模型。
改进了背景特工。虽然本文主要聚焦于实时交互性,智能智能同样是一项必不可少的能力。除了将智能智能推向前沿,我们相信我们刚刚触及了背景智能体如何与交互模型协同工作的表面。
告诉我们你的想法,加入我们吧
未来几个月,我们将开放有限的研究预览以收集反馈,今年晚些时候会发布更广泛的版本。
我们很希望你能加入我们.请在 interaction@thinkingmachines.ai 分享你的想法。
引用
请引用此作品:
Thinking Machines Lab, "Interaction Models: A Scalable Approach to Human-AI Collaboration",
Thinking Machines Lab: Connectionism, May 2026.
或者使用BibTeX引用:
@article{thinkingmachines2026interactionmodels,
author = {Thinking Machines Lab},
title = {Interaction Models: A Scalable Approach to Human-AI Collaboration},
journal = {Thinking Machines Lab: Connectionism},
year = {2026},
month = {May},
note = {https://thinkingmachines.ai/blog/interaction-models/},
doi = {10.64434/tml.20260511},
}