كيف نرتّب

كيف تُرتَّب لوحات Best LLM Models: Arena Agent IPS في الصفحة الرئيسية، وتقييمات النص في صفحة النص، وما لا ندّعيه.

معايير تصنيف النماذج

نعتمد مقياسين رسميين فقط دون أي خلط: لوحة الوكلاء تعتمد مقياس Arena Agent IPS (صافي التحسن في المهام التفاعلية متعددة الخطوات)، بينما تعتمد لوحات النصوص والبرمجة والمصادر المفتوحة وتوليد الصور والفيديو تقييمات التفضيل البشري المباشرة في Arena. يشارك تصنيف النماذج المحلية درجات النصوص المفتوحة ولا يمثل قياسًا لحجم ذاكرة VRAM. نلتزم بفصل تام بين المقاييس المختلفة.

مصدر البيانات المعتمد هو مستودع lmarena-ai/leaderboard-dataset (CC BY 4.0). نحن لا نلجأ إلى كشط موقع arena.ai، بل نستورد أحدث لقطة بيانات رسمية تلقائيًا عبر npm run ingest فور نشر LMSYS لتحديث جديد، وليس بمجرد إعلان الشركات عن نماذجها.lmarena-ai/leaderboard-dataset

ماذا توضح أشرطة الترتيب

يمتد طول الشريط نسبيًا من أدنى نموذج في القائمة وحتى المركز الأول (#1). الرقم المثبت على كل شريط هو نتيجة Arena الرسمية الدقيقة (نسبة التحسن IPS للوكلاء أو نقاط التقييم للوحات الأخرى). يعرض كل صف إجمالي المعارك أو الجلسات، إلى جانب تسعير التوكن وسعة نافذة السياق من models.dev. ترمز الألوان إلى الشركات المطورة للنماذج.

معايير تسعير API ونافذة السياق: models.dev

التزامات الشفافية

  • نحن لا ننظم اختبارات تقييم ذاتية ولا ندعي إدارة معارك افتراضية خاصة بنا.
  • لا نستخدم بيانات Artificial Analysis لتحديد ارتفاع الأشرطة أو حساب ترتيب النماذج.
  • لا نخلط نتائج الوكلاء (Agent IPS) مع درجات النصوص أو الصور في لوحة واحدة إطلاقًا.
  • لا ندعي تقديم معايير قياس VRAM للأجهزة الشخصية؛ لوحة النماذج المحلية تعرض النماذج المفتوحة نفسها.
  • لا تتضمن النسخة الحالية أي تقديرات غير موثقة لحجم الاستخدام.

تصنيف النماذج المفتوحة

يُصنف النموذج كمفتوح المصدر إذا تم تمييزه بـ open_weights عبر models.dev أو إذا كان ترخيصه لا يندرج تحت البرمجيات المغلقة أو الاحتكارية، مع شمول التراخيص المفتوحة مجتمعيًا.