Opus 5.5 对决 GPT-6 Sol:我的盲测口味对决结果

请继续收听或观看YouTube,Spotify,或者苹果播客

我早起录制了Opus 5.5的评测。然后Anthropic和OpenAI在同一天早上发布了新模型,我决定做一件以前从未做过的事:让How I AI实验台上直播。我把GPT-6 Astra、GPT-6 Sol、Claude Opus 5.5等都投入到我真正关心的工作中:邮件、PRD、前端原型、后台工作、长期运行的代理、SVG和视频编辑。我对输出评分时不知道是哪个模型做出的,所以你可以看我做预测、改变想法,并展现我自己非常不稳定的品味。Astra赢得了我的心。Opus 5.5赢得了我的一周。Sol依然让我分裂。有一个创意结果我完全错了,一位不同意我的LLM评委,还有回归Barbie Bench:那个不断提醒我我们还有很长路要走的3D时尚游戏。手很悲惨。AGI还没到来。

你将学到的内容:

  1. 我是怎么盲跑 How I AI bench 的,以及什么会导致输出在我还不知道是哪个模型之前就被打低分
  2. 为什么Astra赢得了我的心,而Opus 5.5可能是整体最强的,尤其是对于长期运营的代理和B2B前端来说
  3. 而Sol依然能以清晰的写作、易读的PRD和价格赢得我
  4. 那个角色SVG结果彻底推翻了我对拟人版的预测
  5. 当我让这些模特剪辑视频时发生了什么?为什么我认为技能能解释部分失望的原因
  6. 为什么一位LLM评委不同意我的排名,以及我没有被评为何让我感到欣慰

在本期节目中,我们将涵盖:

(00:00) 现场搭建与新型号发布

(01:30作品5.5、太阳系和月球有什么新内容

(04:11)护栏、个性和速度

(09:00)How I AI bench 和盲评流程

(11:31) 电子邮件与个人生产力结果

(13:50) 前端原型氛围检测

(24:10) 后端、代理个性及长期任务

(28:25) SVG 插图测试

(29:48) AI 视频编辑结果

(30:43揭晓前的预测

(31:20)芭比长椅:3D时尚游戏测试

(34:17) 结果:星、太阳系和作品5.5

(35:04) 写作清晰度与创意惊喜

(36:51) 为什么法学硕士法官不同意我的观点

(37:24) 每个模型实际最适合的领域

参考工具:

• 克洛德作品5.5:https://www.anthropic.com/claude-opus-5-5

• GPT-6 Sol 和 Luna:https://openai.com/index/introducing-gpt-6-sol-and-luna/

• Codex(OpenAI):https://openai.com/codex

在哪里可以找到Claire Vo:

ChatPRD:https://www.chatprd.ai/

网站:https://clairevo.com/

LinkedIn:https://www.linkedin.com/in/clairevo/

X:https://x.com/clairevo

制作与营销https://penname.co/.如需咨询赞助播客,请发送邮件至 jordan@penname.co。

添加评论
点赞收藏
点踩分享查看原文
评论
?
参与讨论