大模型权威排行榜

覆盖全球 300+ 大语言模型,综合质量跑分 · API 价格 · 推理速度 · 上下文窗口,每日自动更新

337 追踪模型
18 供应商
7 核心基准
100 最高质量指数

🏆 综合排行榜

基于 MMLU-Pro、GPQA Diamond、HumanEval、MATH-500、AIME、SWE-bench Verified 六大基准 + Arena ELO 综合评分

# 模型 供应商 质量指数 Arena ELO GPQA Diamond MMLU-Pro HumanEval SWE-bench 速度 (t/s) 输入 $/1M 输出 $/1M 上下文 官网

💵 API 价格实时对比

标准同步调用价格(缓存未命中),单位:美元/百万 Token。价格来源:各厂商官方定价页,每小时校验更新。

📊 工作负载成本计算器

200 万输入 + 50 万输出 Token 标准工作负载估算单次成本

模型 供应商 输入 $/1M 缓存输入 $/1M 输出 $/1M 上下文窗口 估算单次成本 质量/价格比

📐 评测方法论

LexiRank 综合质量指数由以下权威基准加权计算

🧪

MMLU-Pro

大规模多任务语言理解 (Massive Multitask Language Understanding),覆盖 57 个学科领域,衡量模型知识广度与推理能力。

权重: 15%
💎

GPQA Diamond

研究生级别问答基准 (Graduate-Level Google-Proof Q&A),由领域专家编写,考察深度专业知识推理。

权重: 20%
💻

HumanEval+

代码生成能力评测,包含 164 个手写编程问题,验证模型生成正确且健壮代码的能力。

权重: 15%
🔢

MATH-500

数学推理基准,包含 500 道高难度竞赛级数学题,覆盖代数、几何、数论等领域。

权重: 15%
🏗️

SWE-bench Verified

软件工程基准,基于真实 GitHub Issue 评估模型解决实际 Bug 和 Feature 请求的能力。

权重: 20%
🏟️

LMSYS Arena ELO

基于人类偏好盲测的竞技场排名,反映模型在实际对话中的综合表现。

权重: 15%