Opus 5.5 对决 GPT-6 Sol:我的盲测口味对决结果
请继续收听或观看YouTube,Spotify,或者苹果播客
我早起录制了Opus 5.5的评测。然后Anthropic和OpenAI在同一天早上发布了新模型,我决定做一件以前从未做过的事:让How I AI实验台上直播。我把GPT-6 Astra、GPT-6 Sol、Claude Opus 5.5等都投入到我真正关心的工作中:邮件、PRD、前端原型、后台工作、长期运行的代理、SVG和视频编辑。我对输出评分时不知道是哪个模型做出的,所以你可以看我做预测、改变想法,并展现我自己非常不稳定的品味。Astra赢得了我的心。Opus 5.5赢得了我的一周。Sol依然让我分裂。有一个创意结果我完全错了,一位不同意我的LLM评委,还有回归Barbie Bench:那个不断提醒我我们还有很长路要走的3D时尚游戏。手很悲惨。AGI还没到来。
你将学到的内容:
- 我是怎么盲跑 How I AI bench 的,以及什么会导致输出在我还不知道是哪个模型之前就被打低分
- 为什么Astra赢得了我的心,而Opus 5.5可能是整体最强的,尤其是对于长期运营的代理和B2B前端来说
- 而Sol依然能以清晰的写作、易读的PRD和价格赢得我
- 那个角色SVG结果彻底推翻了我对拟人版的预测
- 当我让这些模特剪辑视频时发生了什么?为什么我认为技能能解释部分失望的原因
- 为什么一位LLM评委不同意我的排名,以及我没有被评为何让我感到欣慰
在本期节目中,我们将涵盖:
(00:00) 现场搭建与新型号发布
(01:30作品5.5、太阳系和月球有什么新内容
(04:11)护栏、个性和速度
(09:00)How I AI bench 和盲评流程
(11:31) 电子邮件与个人生产力结果
(13:50) 前端原型氛围检测
(24:10) 后端、代理个性及长期任务
(28:25) SVG 插图测试
(29:48) AI 视频编辑结果
(30:43揭晓前的预测
(31:20)芭比长椅:3D时尚游戏测试
(34:17) 结果:星、太阳系和作品5.5
(35:04) 写作清晰度与创意惊喜
(36:51) 为什么法学硕士法官不同意我的观点
(37:24) 每个模型实际最适合的领域
参考工具:
• 克洛德作品5.5:https://www.anthropic.com/claude-opus-5-5
• GPT-6 Sol 和 Luna:https://openai.com/index/introducing-gpt-6-sol-and-luna/
• Codex(OpenAI):https://openai.com/codex
在哪里可以找到Claire Vo:
ChatPRD:https://www.chatprd.ai/
LinkedIn:https://www.linkedin.com/in/clairevo/
制作与营销https://penname.co/.如需咨询赞助播客,请发送邮件至 jordan@penname.co。