评测方法与排名规则

Best LLM Models 专注于呈现全球主流大语言模型的权威基准排位。本页系统介绍双轨计分机制、多源数据对齐准则与开源认定标准。

核心评分机制与基准

本站采用严格分立的双轨计分机制,避免跨场景混淆:针对智能体(Agent)复杂应用场景,采用 LMSYS Arena 官方评测指标 Agent IPS(衡量模型在真实多轮会话环境中自主调用工具、执行多步骤复杂任务的综合净提升率);在通用文本、编程、开源与多模态场景,采用数百万次人类盲测对战衍生的 Arena Elo Rating 胜率分。两套计分维度各自独立,不作跨维度的简单折算与混排。

权威数据来源:所有评测对抗数据均直接同步自 LMSYS 官方开源数据集 lmarena-ai/leaderboard-dataset(遵循 CC BY 4.0 国际许可协议)。数据基于官方权威快照进行全量自动化校验与同步更新,确保排名的客观性、公信力与严格可复现。lmarena-ai/leaderboard-dataset

可视化图表与规格对齐

排行榜横向柱状图以当前榜单最低基准分为起点、以领跑首位模型为基准进行归一化拉伸呈现。单行卡片同步展示官方基准分、评估场次(多轮对话数或盲测票数);模型调用成本(每百万 Token 输入/输出价格)及上下文窗口(Context Window)容量直接对齐 models.dev 行业开放规范。未收录成本参数的模型仅保留 Arena 官方基准分,绝不作主观臆测。

API 定价及模型上下文对齐规范:models.dev

平台准则与中立声明

  • 坚持第三方独立中立:本站不自行开展闭门评测,不主办商业对抗,完全基于官方权威公开数据进行客观清洗与呈现。
  • 拒绝非官方复合分数:不采用第三方商业复合评分作为排位基准,坚决维护核心评测源头的纯粹性与权威度。
  • 拒绝跨维度混合排位:坚决不在同一榜单中混排 Agent IPS 与通用文本或图像评分,确保不同应用场景独立评估。
  • 严谨标定技术规格参数:不以未经实测验证的显存需求或参数规模误导用户,所有规格均严格源自官方与权威标准库。
  • 完整透明的数据溯源链条:官方数据集、商业授权许可及行业参考标准均提供完整透明的原厂链接,随时接受审计核查。

开源模型界定标准

为帮助企业与开发者准确辨识开放权重模型,本站遵循业界通行的开源认定准则:若模型在 models.dev 行业规范中明确标注为 open_weights,或在 LMSYS Arena 官方元数据中许可协议非专有闭源(Non-Proprietary / Closed),本站均将其界定为开源模型范畴(包含 Apache 2.0、MIT、OpenRAIL 及合规的社区开放许可)。