Seed-2.1-pro-0915 深度实测:多模态 Coding 与 Agent 能力跃升,Seed 基模开始发力

上周和杨攀、橘子、歸藏在「Next Token 词元之外」播客中聊到。

现在很多大模型都开始持续更新,不用版本号。

最近内测的 Doubao-Seed-Evolving 就是这样一款模型。

今年6月,豆包大模型 2.1 发布,已满足生产级任务,成为新的起点。

三个月后,Seed-2.1-pro 升级至 0915 版本,Doubao-Seed-Evolving 同步更新到这个版本。

Evolving 翻译过来是进化的意思,意味着豆包这个大模型会持续进化。

但是,版本稳定也很重要,为方便用户适配,字节技术团队把近期表现最好的版本固化为 Seed-2.1-pro-0915。

模型已接入豆包工作、TRAE等产品中,API 也已上架到火山方舟。

从官方信息看,这个模版强化了多模态 Coding 与 多模态Agent ,Agentic 能力和 Token 效率有显著提升:

复杂仓库理解提升 12.4%,工具调用专项得分从 38.4% 跃至 64.8%,Coding 综合成本下降超 40%。

实测 7 个案例,覆盖深度调研、Mac应用开发、Blender 3D 建模、视频生成、钓点地图等任务。

质量好坏,大家自行判断,建议先收藏再读。

深度调研:Obsidian 热门 AI 插件 Top20

最近沉迷 Obsidian 插件开发。

Qiaomu AI RSS 和 Qiaomu Reader 两款插件上架后,一周安装都已过千。

下一步想开发个类 Claudian 的 AI 插件,开发前先调研:

调研目前最火的 20 个 Obsidian 与 AI 相关的插件,并总结他们的技术特点和优势,并写入飞书文档。

用豆包工作 Seed-2.1-pro-0915 驱动 Agent 完成了这个任务,结果不错。

它自己规划了调研框架,用 "下载量 + 更新频率 + 功能完整度" 三维度评分,然后它并发检索了Obsidian 插件市场和 GitHub,采集了 100+ 候选插件的数据。

不仅对插件做了分类,还交叉验证下载量数据,剔除刷量和重复条目,最后锁定 Top20 并写入了飞书文档。

除了Top20榜单和详细介绍,还给了趋势观察和所有引用的仓库、文章地址,方便核验,有效减少了幻觉。

多模态 Agent:通过视频演示开发跨平台应用

最近在 Producthunt 看到一个叫 PeekFocus 的剪贴板管理应用。

[video]

把功能演示视频丢过去,让它照着开发一个应用。

基于视频功能演示开发一个类似的剪贴板管理 app

总共运行了1小时,界面和功能复刻如下:

首先分析了原应用的功能,选择 PySide6 作为跨平台框架(覆盖 macOS、Windows、Linux)。

然后规划了模块结构:全局快捷键监听、剪贴板历史管理、窗口管理、设置持久化。

从需求到交付,模型自主完成了代码编写、测试运行、Bug 修复和打包配置。

比较遗憾的是,它没用原生Swift开发,所以我让它改造成原生应用。

又运行半小时,终于改成了原生Swift应用。

[video]

按Command + Shift + V 唤起侧边栏,复制任何内容,都会自动收藏整理,有点强!

3D建模:Blende 3D 白模驱动视频生成

最近 GPT-6 带火了一类视频生成玩法。

先用大模型生成 3D 白模动画作为预演,再用视频生成模型基于白模参考出最终成片。

让模型控制 Blender 设计一个博朗收音机,搜索后确定了 T3 袖珍收音机。

操作 blender 设计一个博朗收音机,如果不确定样子,可以搜索

生成白模后,然后 @Seedance 2.5 生成一段 TVC 视频。

[video bolang]

再来个稍微复杂的,先让Blender生成跳舞动画。

让模型分析 Blender 中的动画。

感觉生成的视频比白模动作丰富很多。

[女团]

不需要专业的 3D 动画师,用自然语言描述就能驱动 Blender 生成预演,再用 Seedance 2.5 出片。

这个工作流感觉可以降低复杂场景的视频制作门槛。

应用开发:天津海钓点调研 + 交互式导航地图

作为钓鱼佬,最关心的就是好钓点。

虽然抖音有不少钓点分享,但位置信息往往藏在视频某一帧或主播的某句话中。

收集整理钓点费时费力,还需要在导航软件中搜索收藏,操作非常复杂。

想到 Seed-2.1-pro-0915 是多模态模型,抖音也是字节产品。

那它能不能帮我调研分析大量抖音视频,然后做一个钓点导航工具?说干就干:

我想在天津岸钓鲈鱼和海鲶鱼,你搜索整理抖音所有视频中提到天津海钓点的视频,交叉验证,总结提炼不少于 15 个热门钓点,并制作一个地图,手机点击能调用内置导航前往。

【钓鱼】

任务不仅要调研天津地区适合海钓的钓点,整理钓点信息 15 个(位置、鱼种、最佳季节、交通方式)。

还要生成一个交互式导航地图网页。

没想到,模型竟然一次搞定。

看了收集的钓点,好几个是我常去的,质量靠谱,以后爽了!

从信息检索到数据整理,再到前端代码生成和地图 API 集成,整个过程完全没有人工干预。

视频剪辑:电影3分钟解读

之前为了好玩,我写了一个电影3分钟解读 Skill。

只需输入电影名,即可生成任意电影的快速解读版。

但运行这个Skill,模型必须支持多模态,刚好拿 Seed-2.1-pro-0915 做测试:

用乔木视频剪辑 skill 制作《肖申克的救赎》的 3 分钟解读。

要求模型先写文案,再调用 Listenhub 我的克隆声音,同时会操作 33台词自动找片源、剪视频。

不仅如此,还要模型自己抽帧检查台词、剧情画面、字幕的匹配度,是个挺复杂的长程任务。

总过执行用了大概30分钟左右,成品如下:

【肖申克】

我的感受,脚本文案还差点意思,但台词和画面匹配是真的没毛病,说明多模态能力真的很顶。

这种生成的解读视频,虽然还有点粗糙,但很适合快速了解一部电影剧情。

忍不住又剪辑了两部电影,《这个杀手不太冷》用10分钟,《唐伯虎点秋香》用了8分钟。

《这个杀手不太冷》3分钟解读

【杀手】

再换个星爷的《唐伯虎点秋香》

【唐伯虎】

代码分析:完整Github代码仓库分析

把上周开发的Obsidian插件的源代码丢给模型分析,找出迭代优化空间。

这个项目是用 GPT6-Astra 开发,它给的一句话评价:

这是一个工程质量明显高于普通个人 / AI 协作插件的成熟项目

整个仓库有大约3万5千行代码,它完整分析后给了几个挺有价值的建议。

比如我为了阅读体验,内嵌了朱雀仿宋字体和6本电子书,造成发布包非常接近Obsidian要求的5.2m上限。

它预判下个版本可能会构建失败,需精简。

对代码量最大的main.js做了详细的诊断分析,给出了拆分建议。

分析给出的P0、P1问题,都切中肯綮。

其他:全学科知识点整理、国庆旅游等

给刚上初一的儿子整理的全学科知识点资料库,附游戏化学习网页。

调研初一学生各个学科最该掌握的各科知识,制作一套完整课程,写入飞书文档。

国庆计划带全家去武汉旅游,让它整理一份武汉美食指南。

【国庆】

写在后面

测下来,感受最深的有两点:

一是多模态理解真的在起作用。

把视频丢给它开发应用、让它看 Blender 白模分析动画、用多模态抽帧检查台词和画面匹配。

这些任务放在半年前,要么做不了,要么做得很差。

现在感觉做的比我预期好不少。

二是 Agent 的可靠性在提升。

以前用 Agent 做复杂任务,最怕它“假装完成”,工具没调、结果没回来,它就开始总结了。

这次几个长程任务跑下来,它等结果、查返回、交叉验证的行为明显更稳。

当然也有不足。

视频解读的脚本文案还差点意思,Swift 原生应用第一次没做对,需要二次迭代。

Seed-2.1-pro-0915 是 6 月版本三个月后的升级,官方数据我没法独立验证,但从实测来说,方向是对的,潜力巨大。

Seed-Evolving 这个命名我挺喜欢,持续进化,不锁版本。

对于重度依赖 AI 工具的用户来说,这意味着你用的模型会越来越好,而不是等下一个大版本。

对于需要稳定的生产环境,固化的 0915 版本也在,很务实。

API 已上线火山方舟,豆包工作和 Trae 也开放了这个模型,感兴趣的可以自己跑几个 Case 试试。

添加评论
点赞收藏
点踩分享查看原文
评论
?
参与讨论