🏆 综合排行榜
基于 MMLU-Pro、GPQA Diamond、HumanEval、MATH-500、AIME、SWE-bench Verified 六大基准 + Arena ELO 综合评分
| # | 模型 | 供应商 | 质量指数 | Arena ELO | GPQA Diamond | MMLU-Pro | HumanEval | SWE-bench | 速度 (t/s) | 输入 $/1M | 输出 $/1M | 上下文 | 官网 |
|---|
💵 API 价格实时对比
标准同步调用价格(缓存未命中),单位:美元/百万 Token。价格来源:各厂商官方定价页,每小时校验更新。
📊 工作负载成本计算器
按 200 万输入 + 50 万输出 Token 标准工作负载估算单次成本
| 模型 | 供应商 | 输入 $/1M | 缓存输入 $/1M | 输出 $/1M | 上下文窗口 | 估算单次成本 | 质量/价格比 |
|---|
📈 趋势分析
近半年主要基准分数走势与价格变化
顶级模型质量指数对比
API 价格走势 ($/1M 输出)
各供应商旗舰模型基准雷达图
📐 评测方法论
LexiRank 综合质量指数由以下权威基准加权计算
MMLU-Pro
大规模多任务语言理解 (Massive Multitask Language Understanding),覆盖 57 个学科领域,衡量模型知识广度与推理能力。
权重: 15%GPQA Diamond
研究生级别问答基准 (Graduate-Level Google-Proof Q&A),由领域专家编写,考察深度专业知识推理。
权重: 20%HumanEval+
代码生成能力评测,包含 164 个手写编程问题,验证模型生成正确且健壮代码的能力。
权重: 15%MATH-500
数学推理基准,包含 500 道高难度竞赛级数学题,覆盖代数、几何、数论等领域。
权重: 15%SWE-bench Verified
软件工程基准,基于真实 GitHub Issue 评估模型解决实际 Bug 和 Feature 请求的能力。
权重: 20%LMSYS Arena ELO
基于人类偏好盲测的竞技场排名,反映模型在实际对话中的综合表现。
权重: 15%