Blog

RSS: https://sakana.ai/feed.xml
Sakana AI,东京 AI 研究实验室,基于自然启发智能创建新型基础模型。

Sakana AI发布Fugu-Cyber:面向企业防御的多智能体编排模型

Sakana AI推出Fugu-Cyber,基于多智能体编排架构,在CyberGym和CTI-REALM基准测试中达到86.9%和72.1%的成功率,性能对标GPT-5.5-Cyber等前沿模型。文章强调单纯依赖大模型无法解决企业安全痛点,需结合人工专家审核与本地化代码上下文进行漏洞验证。目前API需申请访问权限,主要面向日本大型金融机构等企业提供自动化漏洞检测服务。
评论点赞收藏26 天前

Sakana AI联手NVIDIA推进开放模型创新

Sakana AI与NVIDIA合作,将Nemotron模型集成至其多智能体编排系统Fugu,旨在通过组合多个开放专用模型来提升AI能力。此举强调模块化与开放性,减少对单一模型的依赖,但缺乏具体的性能数据或技术细节支撑。
评论点赞收藏31 天前

AI Picbreeder实验:无人指引时,AI代理能否展现创造力?

MIT与NYU合作在GECCO 2026发表新论文,利用大型视觉语言模型复现了已关闭的网站Picbreeder。该实验让AI在没有预设目标的情况下,通过用户迭代选择演化出意想不到的图像形态。这一研究为开放式进化(Open-endedness)提供了关键的一手实验数据和见解,揭示了无监督创意涌现的机制。
评论点赞收藏37 天前

通过层流-ADMM 学习多智能体协同

SakanaAI 提出 Sheaf-ADMM 框架,利用层流理论(Sheaf Theory)改进多智能体协同,解决传统单体模型视野局限问题。该研究将 ICML 2026 录用,结合 ADMM 算法实现分布式学习。代码已开源,适合关注多智能体系统、分布式 AI 架构及前沿数学理论在 ML 应用的读者深入探讨。
评论点赞收藏42 天前

连接球形黑盒优化器

ICML 2026 论文探讨黑盒优化(BBO)中参数法与非参数法的融合。针对强化学习和模拟器优化中缺乏梯度的场景,提出连接两类算法的新思路,旨在兼顾高维扩展性与多解搜索能力。
评论点赞收藏43 天前

Sakana 发布 Fugu Ultra:以自主模型编排挑战 Anthropic 前沿地位

Sakana AI 发布了名为 Fugu Ultra 的新模型,声称其性能可与 Anthropic 的 Fable 5 和 Mythos Preview 等前沿模型持平。该模型的核心创新在于“自主模型编排”,即作为一个单一 API 接口,动态调度多个专家模型协同处理复杂的多步骤任务,而非依赖单一巨型单体模型。文章强调这种架构不仅能应对代码审查、网络安全评估等长链路工作流,还能规避单一供应商依赖及出口管制风险,实现所谓的“AI主权”。
评论点赞收藏54 天前

Sakana Fugu:将多模型编排为单一智能体

Sakana AI发布Fugu,一个通过动态编排多个专家模型来解决复杂任务的系统。基于ICLR 2026论文,它不依赖人工设计的工作流,而是让系统自动学习如何协调不同模型。提供Fugu和Fugu Ultra两个版本,在代码、推理、CAD设计、甚至盲棋和股票交易等基准测试中表现优于单一前沿模型。强调其优势在于无需依赖单一供应商即可达到前沿性能,并支持自定义排除特定提供商以满足合规要求。
评论点赞收藏55 天前

Sakana AI 推出首款商用产品:自主研究助手 Sakana Marlin

Sakana AI 发布首款商用产品 Sakana Marlin,定位为“虚拟首席战略官”。该产品基于长期推理和多模型协调技术,能针对指定主题进行长达8小时的自主研究,自动生成结构化总结幻灯片和详细报告。经过约300名来自金融、咨询等行业用户的Beta测试验证,旨在替代传统人工耗时数周的深度战略调研工作。
评论点赞收藏61 天前

Sakana AI成立递归自我改进实验室,探索样本高效的主权AI路径

日本AI实验室Sakana AI宣布成立递归自我改进(RSI)实验室,旨在摆脱单纯堆算力的范式,通过样本高效的进化算法让AI自主改进自身架构和研究流程。文章回顾了该实验室在LLM训练优化、代码生成及科学发现方面的多项成果,并强调利用日本相对有限的算力资源探索主权AI路径。同时发布招聘启事,招募前沿科学家和核心工程师。
评论点赞收藏71 天前

Sakana Fugu:作为基础模型的多智能体编排系统

Sakana AI 发布其旗舰商业产品 Sakana Fugu,这是一个基于多智能体协作的编排系统。不同于传统单一大模型,Fugu 通过动态协调多个前沿基础模型(如 GPT、Gemini 等)来发挥各自优势,在编程、数学和科学推理等任务上取得了超越单一最强模型的基准成绩。该系统基于 ICLR 2026 论文 Trinity 和 Conductor,提供 Mini(低延迟)和 Ultra(高性能)两个版本,并开放 API 供开发者申请 Beta 测试。其核心创新在于模型能自主学习如何组合和调度其他模型,甚至通过递归调用自身实现“测试时扩展”,无需重新训练即可提升复杂任务的解决能力。
评论点赞收藏114 天前

Sakana AI宣布与谷歌达成战略合作伙伴关系

Sakana AI宣布与Google达成战略合作并获得融资。双方将结合Google的基础设施与Sakana的研究能力,重点在三个领域合作:利用Gemini和Gemma模型加速科研自动化和Agent开发;通过一线反馈提升AI产品质量;以及在金融和政府等关键行业部署可靠的AI解决方案。
评论点赞收藏204 天前

数字红皇后:利用LLM在Core War中进行对抗性程序进化

Sakana AI与MIT合作发布研究,利用LLM在Core War(一种汇编语言编程游戏)中模拟“数字红皇后”式的对抗进化。算法让程序不断适应更强对手,发现进化出的代码虽源不同但行为趋同(类似生物收敛进化),且策略比人类设计的更通用。该研究将Core War作为沙盒,用于探索AI在多智能体对抗中的长期动态及网络安全应用。
评论点赞收藏219 天前

Sakana AI智能体赢得AtCoder启发式竞赛:史上首个夺冠AI

Sakana AI的ALE-Agent在AtCoder启发式竞赛AHC058中夺冠,成为首个在大型编程优化竞赛中获得第一名的AI。该Agent在4小时比赛中,通过并行使用多个前沿大模型进行推理时间扩展,自主发现了一种新颖的“虚拟功率”启发式算法和复杂的模拟退火策略,超越了包括人类专家在内的804名参赛者。比赛成本约1300美元。专家评论指出,虽然人类在直觉性思考上仍有优势,但AI凭借海量的试错能力和执行效率,已能解决需要长时间深度推理的复杂问题。这标志着AI在实时、高强度的优化编程任务中达到了顶级人类专家水平。
评论点赞收藏222 天前

AI 科学家:迈向全自动开放式科学发现

Sakana AI 联合牛津大学等机构发布 The AI Scientist 系统,实现了从构思、写代码、跑实验到写论文和同行评审的全自动科研流程。该系统能以约 15 美元的成本在扩散模型、Transformer 等领域生成具备“弱接收”水平的论文,并具备通过反馈迭代改进的能力。文章也指出了当前系统在视觉处理、代码实现准确性及 LLM 数值计算缺陷等方面的局限性,以及可能带来的学术垃圾邮件、伦理安全和科研角色转变等深远影响。
评论点赞收藏272 天前

Sakana AI完成2亿美元B轮融资,主打日本市场的“可持续高效AI”路线

日本AI公司Sakana AI宣布完成320亿日元(约2亿美元)B轮融资,投资方包括MUFG、Khosla Ventures、Google等。公司主张在资源有限的日本走“可持续AI”路线,反对盲目堆算力,提出通过进化算法合并模型、自我改进及开发新型架构(如CTM)来提升效率。资金将用于前沿研发、在日本金融/国防/制造业落地应用以及全球化扩张。
评论点赞收藏272 天前

ShinkaEvolve实战:人机协作如何攻克编程挑战

Sakana AI研究员分享团队利用自家开源框架ShinkaEvolve优化ICFP 2025竞赛代码的案例。通过将SAT编码的Rust代码交给基于LLM的进化框架迭代优化,在320次试验中实现了最高10倍的求解加速,解决了此前无法处理的大规模迷宫问题。更重要的是,AI发现的抽象拓扑表示法(引入辅助变量简化顶点连接逻辑)不仅提升了性能,还启发了人类选手将这一思路应用到后续其他题目中,展示了“人类定义策略+AI执行搜索+人类吸收洞察”的有效协作模式。
评论点赞收藏293 天前

ShinkaEvolve:利用大语言模型高效进化新算法

Sakana AI 发布 ShinkaEvolve 框架,旨在解决现有基于 LLM 的进化算法样本效率低的问题。该框架通过平衡探索与利用、基于新颖性的程序拒绝采样以及任务依赖的 LLM 优先级选择三个创新点,显著提升了搜索效率。在圆堆积、数学推理智能体设计、竞技编程和 MoE 训练损失函数四个不同领域进行了测试,均取得了优于基线或最新状态的结果,且所需样本量大幅减少。项目已开源,并提供交互式 WebUI,定位为科学家和工程师的辅助发现工具。
评论点赞收藏323 天前

推理时扩展与集体智能:让前沿大模型协作解题

Sakana AI 提出 AB-MCTS 算法,让多个前沿大模型在推理时协作。通过自适应分支蒙特卡洛树搜索,模型能动态选择深度优化还是广度尝试,以及使用哪个模型。在 ARC-AGI-2 基准测试中,组合 o4-mini、Gemini-2.5-Pro 和 R1 的效果显著优于单一模型,证明多模型协作能解决单模型无法处理的问题。
评论点赞收藏411 天前

登录芦苇

登录后关注作者、收藏内容和参与讨论。