Artificial Analysis

Artificial Analysis,独立 AI 模型性能、速度与价格对比基准测试平台,帮助开发者选择最适合其场景的模型。

Gemini 3.7 Flash:智能与任务耗时的帕累托前沿

Google发布Gemini 3.7 Flash,智能指数56,速度比GPT-5.6快40% Gemini 3.7 Flash高推理模式智能指数56,较3.6提升4分,接近GPT-5.6 Terra的57分。平均任务耗时1.7分钟,输出约340 token/秒,是GPT-5.6的3倍。年终结算前享半价,单任务成本0.40美元,较3.6降低30%。在AutomationBench-AA和AA-AnalystAgent基准测试中领先,上下文窗口保持1M tokens不变。
评论点赞收藏2 天前

Qwen3.8 2.4T A95B:智能、性能与价格分析

Artificial Analysis 发布 Qwen3.8 2.4T A95B 模型的多维度评测数据,涵盖智能指数、成本、速度、延迟等指标。该模型在 Intelligence Index v4.1.1 的 9 项评测中有具体得分,支持长上下文窗口,MoE 架构下活跃参数远小于总参数。定价按输入、缓存命中、输出分档计费,推理速度以 tokens/秒衡量。
评论点赞收藏2 天前

Gemini 3.7 Flash 性能与成本评测:智能指数、速度和定价全解析

Gemini 3.7 Flash 在 Artificial Analysis 的9项评测中展示性能与成本数据。 涵盖推理、知识、代码、幻觉率、长上下文等维度,附带 AA-Briefcase 和 AA-Omniscience 专项指标。 输入、缓存命中、推理、输出各阶段 token 价格分开列出,可按任务类型计算实际成本。 输出速度、首 token 延迟、端到端响应时间等性能指标同步提供,便于与同类模型对比。
评论点赞收藏2 天前

DeepSeek V4 Pro 0813:智能、性能与价格分析

Artificial Analysis 发布 DeepSeek V4 Pro 模型的多维度评测数据,涵盖智能指数、开放指数、成本、速度、延迟等指标。文章以基准测试结果和性能对比为主,提供模型选型参考数据。
评论点赞收藏3 天前

Grok 4.6智能指数得分61,跻身前沿阵营,代理性能突出且成本更低

Grok 4.6在Artificial Analysis智能指数上得分61,与GPT-5.6 Sol持平,仅次于Claude Opus 5(63分)。定价维持$2/$6每百万token,比Claude Opus 5和GPT-5.6 Sol低60%以上,每任务成本仅$0.84。在代理任务上表现突出:τ³-Banking得分50.7%(与Qwen3.8 Max并列前二),Terminal-Bench v2.1得分88.4%。长程知识工作任务平均仅需53轮对话和0.5B输入token,约为Claude Opus 5的一半和四分之一。上下文窗口500k token,缓存命中价格从$0.3上调至$0.5。
评论点赞收藏3 天前

Grok 4.6 智能、性能与价格分析

Artificial Analysis 发布 Grok 4.6 的基准测试数据,涵盖 9 项评估指标、AA-Briefcase 智能工作表现、幻觉率、成本 per task 及 token 定价。
评论点赞收藏3 天前

Muse Glimmer 智能指数、性能与成本分析

Artificial Analysis 发布 Muse Glimmer 模型的多维度基准评测,涵盖 9 项评估指标,包括推理能力、知识可靠性、幻觉率、长上下文推理等。成本按输入、缓存命中、推理和输出 token 分别计算,提供每任务加权平均成本。上下文窗口和开源参数信息一并列出,适合模型选型参考。
评论点赞收藏5 天前

Qwen3.8 Max 在 Artificial Analysis Agentic Index 中登顶

Qwen3.8 Max 在 Artificial Analysis 的 Agentic Index 中排名首位,超越其他主流模型。该指数基于 GDPval-AA v2 和 τ³-Banking 两个基准的加权平均,衡量 AI 在工具调用、规划、自主执行等 agent 工作流中的表现。Intelligence Index v4.1 共纳入 9 项评估,涵盖编码、科学推理、长上下文、知识可靠性等维度。页面同时提供各模型的成本、速度和输出 token 数据对比。
评论点赞收藏9 天前

Qwen3.8 Max 智能、性能与价格分析

Artificial Analysis 对 Qwen3.8 Max 做了全面基准测试,涵盖智能指数、成本、速度、延迟等维度。该模型在 GDPval-AA、Terminal-Bench、GPQA Diamond 等 9 项评测中有具体得分,支持 1M+ token 上下文窗口,推理模式含 thinking time。定价按 input、cache hit、output、reasoning token 分别计费,适合需要对比开源/闭源模型性价比的开发者参考。
评论点赞收藏9 天前

Muse Spark 1.2 智能、性能与价格分析

Artificial Analysis 发布 Muse Spark 1.2 模型的多维度评测数据,涵盖 9 项基准测试的综合智能指数、各分项得分、每任务成本、输出 token 用量及上下文窗口。页面同时提供与同类模型的性价比对比和 Pareto 前沿线,适合在做模型选型时参考成本与性能的权衡。
评论点赞收藏10 天前

Claude Opus 5 模型性能与成本深度评测

Artificial Analysis 发布 Claude Opus 5 的详细基准测试数据,涵盖 Intelligence Index v4.1(含 GDPval、Terminal-Bench 等9项评估)、AA-Briefcase 智能体工作流表现、幻觉率(AA-Omniscience)及成本效益。内容包含各维度评分、每任务成本、Token 消耗、输出速度、首字延迟及端到端响应时间,并对比不同提供商的缓存定价策略。
评论点赞收藏22 天前

Kimi K3:在 AA-Briefcase 基准测试中表现仅次于 Fable 5

Artificial Analysis 发布 Kimi K3 在 AA-Briefcase(代理知识工作基准)上的评测结果。该模型综合得分 1543,仅次于 Claude Fable 5,超越 GPT-5.6 Sol 和 Opus 4.8。但代价高昂:单次任务平均耗时近 1 小时,成本约 10.57 美元,是 Fable 5 的两倍多。主要瓶颈在于多轮交互次数多(83 轮)及输出 Token 量大,展示能力相对较弱。
评论点赞收藏25 天前

Gemini 3.6 Flash (High) 智力、性能与价格深度分析

Artificial Analysis 发布 Gemini 3.6 Flash (High) 的详细评测数据。涵盖 Intelligence Index v4.1 综合智力排名、AA-Briefcase 智能体工作流表现、幻觉控制(AA-Omniscience)、端到端响应速度及延迟。重点提供各维度成本分析,包括单任务加权平均价格、Token 消耗效率及不同提供商的缓存定价差异,为开发者选型提供量化依据。
评论点赞收藏25 天前

Kimi K3 智能、性能与价格深度分析

Artificial Analysis 对 Moonshot Kimi K3 进行了全面基准测试。涵盖智力指数(9项评测)、成本效率、推理速度及延迟。数据对比了开源与闭源模型,提供按任务计费的加权平均成本分析。对于关注国产大模型实际落地性能、API 调用性价比以及工程部署延迟的技术团队,这份详细的一手量化数据极具参考价值。
评论点赞收藏30 天前

Thinking Machines 发布 Inkling:超越 Nemotron 的美国最强开源多模态模型

Thinking Machines 发布 Inkling,975B 参数(激活 41B),支持文本、图像、音频多模态输入。在 Artificial Analysis 智能指数上得分 41,超越 Nemotron 3 Ultra 和 Gemma 4,成为美国实验室领先的开源权重模型。其代理性能(GDPval-AA v2 Elo 1238)优于 Kimi K2.6 和 DeepSeek v4 Flash,且 Token 效率更高。提供 Tinker API 及 HuggingFace 权重下载。
评论点赞收藏30 天前

GPT-5.6 Sol、Terra、Luna 智能与成本对比

Artificial Analysis 发布 GPT-5.6 系列模型性能评测。数据显示,在推理效率上,Sol 和 Luna 版本在同等成本下智能表现优于 Terra 版本,且 Luna 具备极高的性价比。该图表为开发者选择不同推理强度的模型提供了直观的成本效益参考。
评论点赞收藏32 天前

GPT-5.6 Sol 基准测试结果详解

Artificial Analysis 发布了 GPT-5.6 Sol 在 Intelligence Index v4.1 中的详细基准测试数据,涵盖推理、代码、幻觉率及多智能体工作流表现。文章同时列出了各维度的成本、延迟与吞吐量指标,为评估该模型在实际生产环境中的性价比提供量化参考。
评论点赞收藏37 天前

登录芦苇

登录后关注作者、收藏内容和参与讨论。