Tryai

在一个地方与 GPT-5.5、Claude Opus、Gemini 3 Pro、Grok 等 30+ 前沿 AI 模型对话,还支持图像、视频和音乐生成。无订阅,按量付费。

用 GPT-5.6、Claude、Gemini 和 Grok 画蒙娜丽莎

Tryai 测试 GPT-5.6 Sol、Claude Fable 5、Grok 4.5 和 Gemini 3.6 Flash 在虚拟画布上绘制名画的能力。GPT-5.6 Sol 综合表现最佳且成本最低(约 7.74 美元),Claude Fable 5 虽质量尚可但耗时耗资巨大(约 160 美元)。有趣的是,所有模型均存在“过度编辑”现象:反复查看画布后最终得分反而低于中途峰值。Gemini 3.6 Flash 结构相似度最高但波动大,Grok 4.5 表现最差。
评论点赞收藏25 天前

百美元 AI 音乐视频实战:Claude Fable 5 对决 GPT-5.6 Sol

TryAI 实测 Claude Fable 5 与 GPT-5.6 Sol 在 $25 和 $100 预算下自动生成 MV 的全过程。文章披露了详细的工具调用日志、Token 消耗、生成成本及视频质量对比。结果显示两者在角色一致性、歌词理解和节奏匹配上仍有明显缺陷,且均未进行有效的自我迭代优化。附带完整开源代码和原始数据,适合关注 Agent 自主规划能力、多模态生成现状及成本结构的开发者深入参考。
评论点赞收藏30 天前

GPT-5.6、Grok 4.5、Claude 与 Muse Spark 同场竞技:四款应用构建实测

横向测试 12 款最新模型(含 GPT-5.6 三档、Meta Muse Spark、Grok 4.5 及多款开源模型)。GPT-5.6 Sol 在 3D 迷宫中表现最强,Grok 性价比极高;Claude Fable 在魔方还原上完美,但在 3D 任务中意外翻车。开源模型在简单任务(计算器、生命游戏)上极具竞争力,但在复杂逻辑下仍不稳定。文章附带所有原始构建链接,方便开发者亲自验证各模型在代码生成与调试上的真实差距。
评论点赞收藏36 天前

实测:让Grok 4.5、GPT-5.5和Claude用同一提示词开发应用

作者在同一提示下测试了Grok 4.5、GPT-5.5及两款Claude模型的代码生成能力,涵盖3D魔方、粒子沙盒等任务。结果显示Claude在复杂逻辑上更稳定,而Grok在速度和成本上具有显著优势。 文章还对比了各模型的响应延迟与费用,并附带了趣味绘图测试,为开发者选择模型提供了直观的工程参考。
评论点赞收藏38 天前

登录芦苇

登录后关注作者、收藏内容和参与讨论。