使用场景指南
最适合数学与多步推理的 LLM API
数学和推理类任务往往会产生很长的中间推导步骤,所以输出价格通常比输入价格更重要。以下是我们追踪的旗舰型模型,按最低输出价格优先排序。
数学和多步推理类任务往往会在得出最终答案之前,先生成一长串中间推导步骤——输出内容常常比触发它的提示词大得多。这让成本重心从输入价格转移到了输出价格上。这份榜单筛选旗舰型模型,按输出价格从低到高排序,因为厂商通常把最强的推理能力放在旗舰级别。
ℹ️该列表的筛选方式: 筛选旗舰级别,按输出价格从低到高排序。
我们不针对特定任务的质量做基准测试 — 此列表仅基于核实价格和公开上下文窗口构建。用它按成本筛选候选模型,再自行评估输出质量。
常见问题
我们并不直接衡量数学准确率,但厂商通常把旗舰模型——而不是经济型或均衡型——定位为专为复杂推理打造的产品。这份榜单反映的是厂商自己的定位,而不是我们做的独立测试。
推理密集型任务在给出最终答案之前,往往会生成大量中间推导内容,所以回复长度可能是提示词的许多倍。由于输出 token 是单独计费的,这会让账单更多地压在输出价格上。
很多时候可以——部分厂商允许你为每次调用设置推理(“思考”)预算上限,这能直接减少输出 token、降低成本,但在更难的问题上可能会牺牲一些准确率。具体请查看相应模型的文档。