使用场景指南

最适合数学与多步推理的 LLM API

数学和推理类任务往往会产生很长的中间推导步骤,所以输出价格通常比输入价格更重要。以下是我们追踪的旗舰型模型,按最低输出价格优先排序。

数学和多步推理类任务往往会在得出最终答案之前,先生成一长串中间推导步骤——输出内容常常比触发它的提示词大得多。这让成本重心从输入价格转移到了输出价格上。这份榜单筛选旗舰型模型,按输出价格从低到高排序,因为厂商通常把最强的推理能力放在旗舰级别。

ℹ️该列表的筛选方式: 筛选旗舰级别,按输出价格从低到高排序。
5 个模型
模型 服务商 输入 /百万 输出 /百万 上下文
xAI $2.00 $6.00 50万 tokens
Google $2.00 $12.00 ≤20万 tokens 档位
Anthropic $5.00 $25.00 100万 tokens
Anthropic $10.00 $50.00 100万 tokens
OpenAI $10.00 $50.00 约105万 tokens

我们不针对特定任务的质量做基准测试 — 此列表仅基于核实价格和公开上下文窗口构建。用它按成本筛选候选模型,再自行评估输出质量。

查看所有使用场景 →

常见问题

我们并不直接衡量数学准确率,但厂商通常把旗舰模型——而不是经济型或均衡型——定位为专为复杂推理打造的产品。这份榜单反映的是厂商自己的定位,而不是我们做的独立测试。

推理密集型任务在给出最终答案之前,往往会生成大量中间推导内容,所以回复长度可能是提示词的许多倍。由于输出 token 是单独计费的,这会让账单更多地压在输出价格上。

很多时候可以——部分厂商允许你为每次调用设置推理(“思考”)预算上限,这能直接减少输出 token、降低成本,但在更难的问题上可能会牺牲一些准确率。具体请查看相应模型的文档。