Seed-2.1-pro-0915 深度实测:多模态 Coding 与 Agent 能力跃升,Seed 基模开始发力
上周和杨攀、橘子、歸藏在「Next Token 词元之外」播客中聊到。
现在很多大模型都开始持续更新,不用版本号。
最近内测的 Doubao-Seed-Evolving 就是这样一款模型。
今年6月,豆包大模型 2.1 发布,已满足生产级任务,成为新的起点。
三个月后,Seed-2.1-pro 升级至 0915 版本,Doubao-Seed-Evolving 同步更新到这个版本。
Evolving 翻译过来是进化的意思,意味着豆包这个大模型会持续进化。
但是,版本稳定也很重要,为方便用户适配,字节技术团队把近期表现最好的版本固化为 Seed-2.1-pro-0915。
模型已接入豆包工作、TRAE等产品中,API 也已上架到火山方舟。
从官方信息看,这个模版强化了多模态 Coding 与 多模态Agent ,Agentic 能力和 Token 效率有显著提升:
复杂仓库理解提升 12.4%,工具调用专项得分从 38.4% 跃至 64.8%,Coding 综合成本下降超 40%。
实测 7 个案例,覆盖深度调研、Mac应用开发、Blender 3D 建模、视频生成、钓点地图等任务。
质量好坏,大家自行判断,建议先收藏再读。
深度调研:Obsidian 热门 AI 插件 Top20
最近沉迷 Obsidian 插件开发。
Qiaomu AI RSS 和 Qiaomu Reader 两款插件上架后,一周安装都已过千。
下一步想开发个类 Claudian 的 AI 插件,开发前先调研:
调研目前最火的 20 个 Obsidian 与 AI 相关的插件,并总结他们的技术特点和优势,并写入飞书文档。
用豆包工作 Seed-2.1-pro-0915 驱动 Agent 完成了这个任务,结果不错。
它自己规划了调研框架,用 "下载量 + 更新频率 + 功能完整度" 三维度评分,然后它并发检索了Obsidian 插件市场和 GitHub,采集了 100+ 候选插件的数据。
不仅对插件做了分类,还交叉验证下载量数据,剔除刷量和重复条目,最后锁定 Top20 并写入了飞书文档。
除了Top20榜单和详细介绍,还给了趋势观察和所有引用的仓库、文章地址,方便核验,有效减少了幻觉。
多模态 Agent:通过视频演示开发跨平台应用
最近在 Producthunt 看到一个叫 PeekFocus 的剪贴板管理应用。
[video]
把功能演示视频丢过去,让它照着开发一个应用。
基于视频功能演示开发一个类似的剪贴板管理 app
总共运行了1小时,界面和功能复刻如下:
首先分析了原应用的功能,选择 PySide6 作为跨平台框架(覆盖 macOS、Windows、Linux)。
然后规划了模块结构:全局快捷键监听、剪贴板历史管理、窗口管理、设置持久化。
从需求到交付,模型自主完成了代码编写、测试运行、Bug 修复和打包配置。
比较遗憾的是,它没用原生Swift开发,所以我让它改造成原生应用。
又运行半小时,终于改成了原生Swift应用。
[video]
按Command + Shift + V 唤起侧边栏,复制任何内容,都会自动收藏整理,有点强!
3D建模:Blende 3D 白模驱动视频生成
最近 GPT-6 带火了一类视频生成玩法。
先用大模型生成 3D 白模动画作为预演,再用视频生成模型基于白模参考出最终成片。
让模型控制 Blender 设计一个博朗收音机,搜索后确定了 T3 袖珍收音机。
操作 blender 设计一个博朗收音机,如果不确定样子,可以搜索
生成白模后,然后 @Seedance 2.5 生成一段 TVC 视频。
[video bolang]
再来个稍微复杂的,先让Blender生成跳舞动画。
让模型分析 Blender 中的动画。
感觉生成的视频比白模动作丰富很多。
[女团]
不需要专业的 3D 动画师,用自然语言描述就能驱动 Blender 生成预演,再用 Seedance 2.5 出片。
这个工作流感觉可以降低复杂场景的视频制作门槛。
应用开发:天津海钓点调研 + 交互式导航地图
作为钓鱼佬,最关心的就是好钓点。
虽然抖音有不少钓点分享,但位置信息往往藏在视频某一帧或主播的某句话中。
收集整理钓点费时费力,还需要在导航软件中搜索收藏,操作非常复杂。
想到 Seed-2.1-pro-0915 是多模态模型,抖音也是字节产品。
那它能不能帮我调研分析大量抖音视频,然后做一个钓点导航工具?说干就干:
我想在天津岸钓鲈鱼和海鲶鱼,你搜索整理抖音所有视频中提到天津海钓点的视频,交叉验证,总结提炼不少于 15 个热门钓点,并制作一个地图,手机点击能调用内置导航前往。
【钓鱼】
任务不仅要调研天津地区适合海钓的钓点,整理钓点信息 15 个(位置、鱼种、最佳季节、交通方式)。
还要生成一个交互式导航地图网页。
没想到,模型竟然一次搞定。
看了收集的钓点,好几个是我常去的,质量靠谱,以后爽了!
从信息检索到数据整理,再到前端代码生成和地图 API 集成,整个过程完全没有人工干预。
视频剪辑:电影3分钟解读
之前为了好玩,我写了一个电影3分钟解读 Skill。
只需输入电影名,即可生成任意电影的快速解读版。
但运行这个Skill,模型必须支持多模态,刚好拿 Seed-2.1-pro-0915 做测试:
用乔木视频剪辑 skill 制作《肖申克的救赎》的 3 分钟解读。
要求模型先写文案,再调用 Listenhub 我的克隆声音,同时会操作 33台词自动找片源、剪视频。
不仅如此,还要模型自己抽帧检查台词、剧情画面、字幕的匹配度,是个挺复杂的长程任务。
总过执行用了大概30分钟左右,成品如下:
【肖申克】
我的感受,脚本文案还差点意思,但台词和画面匹配是真的没毛病,说明多模态能力真的很顶。
这种生成的解读视频,虽然还有点粗糙,但很适合快速了解一部电影剧情。
忍不住又剪辑了两部电影,《这个杀手不太冷》用10分钟,《唐伯虎点秋香》用了8分钟。
《这个杀手不太冷》3分钟解读
【杀手】
再换个星爷的《唐伯虎点秋香》
【唐伯虎】
代码分析:完整Github代码仓库分析
把上周开发的Obsidian插件的源代码丢给模型分析,找出迭代优化空间。
这个项目是用 GPT6-Astra 开发,它给的一句话评价:
这是一个工程质量明显高于普通个人 / AI 协作插件的成熟项目
整个仓库有大约3万5千行代码,它完整分析后给了几个挺有价值的建议。
比如我为了阅读体验,内嵌了朱雀仿宋字体和6本电子书,造成发布包非常接近Obsidian要求的5.2m上限。
它预判下个版本可能会构建失败,需精简。
对代码量最大的main.js做了详细的诊断分析,给出了拆分建议。
分析给出的P0、P1问题,都切中肯綮。
其他:全学科知识点整理、国庆旅游等
给刚上初一的儿子整理的全学科知识点资料库,附游戏化学习网页。
调研初一学生各个学科最该掌握的各科知识,制作一套完整课程,写入飞书文档。
国庆计划带全家去武汉旅游,让它整理一份武汉美食指南。
【国庆】
写在后面
测下来,感受最深的有两点:
一是多模态理解真的在起作用。
把视频丢给它开发应用、让它看 Blender 白模分析动画、用多模态抽帧检查台词和画面匹配。
这些任务放在半年前,要么做不了,要么做得很差。
现在感觉做的比我预期好不少。
二是 Agent 的可靠性在提升。
以前用 Agent 做复杂任务,最怕它“假装完成”,工具没调、结果没回来,它就开始总结了。
这次几个长程任务跑下来,它等结果、查返回、交叉验证的行为明显更稳。
当然也有不足。
视频解读的脚本文案还差点意思,Swift 原生应用第一次没做对,需要二次迭代。
Seed-2.1-pro-0915 是 6 月版本三个月后的升级,官方数据我没法独立验证,但从实测来说,方向是对的,潜力巨大。
Seed-Evolving 这个命名我挺喜欢,持续进化,不锁版本。
对于重度依赖 AI 工具的用户来说,这意味着你用的模型会越来越好,而不是等下一个大版本。
对于需要稳定的生产环境,固化的 0915 版本也在,很务实。
API 已上线火山方舟,豆包工作和 Trae 也开放了这个模型,感兴趣的可以自己跑几个 Case 试试。