Thinking Machines Lab

RSS: https://thinkingmachines.ai/index.xml
Thinking Machines Lab,专注于 AI 能力评估与对齐的研究机构。

通往开放权重的安全路径

<blockquote> <strong>摘要:</strong>安全的开放权重模型是一种公共产品,因为它将人工智能的研发与安全工作交到更多人手中,并使训练过程中的各项选择得以公开检视。然而,开放模型也确实存在被滥用的风险,且一旦发布便难以撤销。要实现安全发布,我们必须同时考量模型本身及其所处的生态系统。就模型而言,我们开展严格的安全测试,并研究是否能够将潜在的危险能力从通用智能中解耦;就生态系统而言,我们通过分阶段发布、支持防御方以及与安全研究者协作等方式,提升其应对能力。在不断积累生态系统韧性的同时,依据现有证据逐步选择最开放的方案,我们便能以稳妥的方式迈向真正的开放。</blockquote><p>Thinking Machines 的 使命是打造能够延展人类意志与判断的人工智能。为践行这一使命,我们近期发布了 和 ——两款可供任何人拥有、运行并进行定制的开放权重语言模型。</p><p>强大的开放权重模型让人工智能的研发掌握在更多人手中。我们认为这是一件好事:关于人工智能应当如何发挥作用的知识本就存在于一线从业者的心中,因此他们理应能够直接塑造自己的模型。<br><br>所有模型,包括我们自己的模型,都承载着训练者的假设与偏见;而开放权重则使这些选择变得可检视、可修正。若缺乏强有力的开放模型,训练与部署方面的专业能力或将日益集中于少数实验室,导致其他各方在理解、适配乃至治理这项技术时愈发力不从心。</p><h2>开放权重模型同样面临被滥用的风险</h2><p>权重一旦公开,任何人都可以使用,其中也包…</p>
评论点赞收藏60 天前

Inkling-Small:12B激活参数的MoE模型以四分之一体积实现与Inkling相当的性能

Thinking Machines Lab发布开源权重模型Inkling-Small,12B激活参数、276B总参数的混合专家架构模型在推理和智能体任务上达到与41B激活参数Inling相当甚至更优的水平。 该模型支持音频/图像原生推理、最高1M token上下文窗口,并可在Tinker平台进行微调及多模态对话。 Inkling-Small在Humanity's Last Exam得分31.6%(高于Inkling的29.7%),SWEBench-Verified超过80%,在Terminal-Bench 2.1等基准测试中展现出比同尺寸模型更高的性能-计算效率比。 模型采用可调节的思考强度机制,允许用户根据场景平衡成本与性能。
评论点赞收藏61 天前

Murati创办公司发布开源975B参数大模型Inkling

Ismail Murati创办的Thinking Machines Lab发布开源权重大模型Inkling。该模型采用MoE架构,总参数975B,激活参数41B,支持文本、图像和音频多模态输入,上下文窗口达1M tokens。 亮点包括原生语音处理、可控思考时间以平衡速度与性能,以及校准过的置信度预测。提供Tinker训练平台供微调。
评论点赞收藏76 天前

Inkling:我们的开源权重模型

Thinking Machines Lab发布开源权重模型Inkling,975B参数(41B激活),支持1M上下文及原生多模态推理。亮点在于可控思考效率,能以更少Token达到同等性能。 在预测校准、指令遵循及安全拒绝方面表现强劲,适合需要深度定制和低成本部署的技术团队。
评论点赞收藏76 天前

值得构建的未来以人为本:Thinking Machines Lab 的技术哲学

<p>“思维机器”的使命,是打造能够延伸人类意志与判断力的人工智能。</p><p>如今,人工智能的性能日益提升,但究竟由谁来决定其发展方向,则取决于我们——无论是个人、<br>组织,还是整个人类。这些决策需要人们通过持续接触工作实践而获得的知识与判断力,<br>而这些工作往往正越来越多地与人工智能协同完成。<br>塑造先进智能的目标,同样是一个不断反馈、不断学习、不断调整的过程。</p><p>当今市面上大多数人工智能都是在少数几个特定领域进行训练,随后被“冻结”起来。<br>它们并未真正融入服务对象的生活之中,也难以从用户共同完成的工作中汲取太多经验与启示。<br>要延伸人类的意志与判断力,就需要像人类自身一样多元且分布广泛的AI。<br>这正是我们所选择的道路。</p><p>为了在这一道路上不断前行,我们正致力于以下几个技术方向:</p><ul><li>我们致力于打造强大的模型,推动多模态交互、自定义化等能力的进一步发展。精准的工具能够拓展人类的意志,而人类的判断力则需要塑造那些在前沿领域展开竞争的模型。</li><li>我们开发了各类工具,帮助人们将人工智能“个性化”,根据自身独特的需求对模型进行定制化改造。这包括对模型权重进行训练的能力。</li><li>我们设计了多种界面,拓宽人机之间的沟通渠道,使人类的判断力能够持续影响人工智能的工作。</li><li>我们定期发布研究成果,向科学界公开我们的探索与发现,因为要真正塑造人工智能,就必须深入理解其背后的运作机制。</li></ul><p>我们坚信:值得建设的未来,属于人类——由人类的知识塑造,由人类的意志引领,由人类的判…</p>
评论点赞收藏78 天前

桥水团队实战:如何用专家数据微调模型,超越前沿大模型

Thinking Machines Lab 团队利用桥水基金专家标注的高质量数据,微调了基于 Qwen3-235B 的模型。实验显示,该定制模型在金融文档过滤等六项任务上的准确率(84.7%)超越了 Gemini、Claude 和 GPT 等前沿模型,且推理成本降低了 13.8 倍。 文章详细披露了训练技巧,包括交错批处理、CISPO 损失函数以及在线策略蒸馏。这证明了在特定垂直领域,针对组织需求定制的“差异化智能”模型,比通用大模型更具性价比和实用性。
评论点赞收藏91 天前

交互模型:实时人工智能协作框架

<p>今天,我们宣布互动模型的研究预览:这些模型能够原生处理交互,而非通过外部支架。我们认为互动应与智能同步扩展;我们与人工智能的合作不应被视为事后考虑。<br><br>交互模型让人们能够像我们自然协作一样与人工智能协作——它们持续接收音频、视频和文本,实时思考、响应和行动。</p><p>我们从零开始训练交互模型。为确保实时响应,我们采用多流微转向设计。我们的研究预览展示了质的全新交互能力,以及智能和响应性方面最先进的综合性能。</p><h2>合作瓶颈</h2><p>人工智能实验室通常将人工智能自主工作的能力视为模型最重要的能力。夸,T.,韦斯特,B.,贝克尔,J.等。衡量人工智能完成长时间任务的能力。<br><br>, 2025.因此,如今的模型和界面并未优化,无法让人类保持在信息循环中。A他指出:“重要的是,我们发现当以交互式、同步、'手动键盘'模式使用时,模型的优势不那么明显。以这种方式使用时,一些用户觉得[我们的模型]太慢,未能充分发挥其价值。自主且长期运行的代理机束更能激发模型的编码能力。”</p><p>自主接口很有价值,但在大多数实际工作中,用户无法事先完全明确需求然后离开——良好的结果受益于协作过程,人类保持参与,在过程中澄清并反馈。<br><br>然而,人类越来越多地被排挤,并非因为工作不需要他们,而是因为界面没有空间容纳他们。相反,当人们能像与他人一样与人工智能协作时,效果最佳:发送消息、交谈、倾听、观察、展示和插入——模型也能做到同样的操作。<br><br>沟通…</p>
评论点赞收藏141 天前

On-Policy [LLM] Distillation

LLMs are capable of expert performance in focused domains, a result of several capabilities stacked together: perception of input, knowledge retrieval, plan selection, and reliable execution. This req...
评论点赞收藏146 天前

训练大语言模型预测世界事件

本文展示了如何通过任务特定的强化学习微调,将开源大语言模型 gpt-oss-120b 的预测能力提升至与前沿闭源模型相当的水平,并在集成预测中发挥关键作用。
评论点赞收藏170 天前

Tinker:机器学习研究项目征集

Thinking Machines Lab 推出 Tinker 平台,公开征集社区机器学习研究项目,涵盖算法复现、新型训练方法、跨领域应用等,并提供多个具体研究建议,鼓励高质量实验与开源分享。
评论点赞收藏315 天前

Tinker by Thinking Machines

Tinker 是 Thinking Machines 推出的训练 API,通过四个核心函数简化模型训练流程,支持多种开源模型与 LoRA 高效微调,屏蔽基础设施细节,帮助研究者和开发者快速迭代。
评论点赞收藏363 天前

模块化流形:将神经网络权重约束在数学流形上以实现稳定训练

本文提出将神经网络权重矩阵约束在数学流形(如Stiefel流形)上,以控制张量范数、奇异值和条件数,从而稳定训练。介绍了一种新颖的“流形Muon”优化器,结合谱范数约束与流形几何,提供可预测的更新步长和更强的鲁棒性。 还提出了“模块化流形”概念,作为构建和训练大型网络的组合框架。
评论点赞收藏368 天前

战胜 LLM 推理中的非确定性

本文深入剖析大语言模型推理非确定性的根源,推翻“并发+浮点”假说,揭示批处理大小波动才是主因。提出通过实现核函数的批不变性来达成可复现推理,为LLM部署提供实用优化方向。
评论点赞收藏384 天前

Thinking Machines Lab

AI研究公司Thinking Machines Lab发布公开信,宣布其使命是构建更广泛理解、可定制且能力更强的AI系统。团队曾开发ChatGPT、、PyTorch等主流AI产品,强调科学共享、人机协作、模型智能、基础设施质量及多模态能力,并计划通过技术博客、论文和代码与社区合作推进AI发展。
评论点赞收藏588 天前

登录芦苇

登录后关注作者、收藏内容和参与讨论。