كيف نرتّب
كيف تُرتَّب لوحات Best LLM Models: Arena Agent IPS في الصفحة الرئيسية، وتقييمات النص في صفحة النص، وما لا ندّعيه.
معايير تصنيف النماذج
نعتمد مقياسين رسميين فقط دون أي خلط: لوحة الوكلاء تعتمد مقياس Arena Agent IPS (صافي التحسن في المهام التفاعلية متعددة الخطوات)، بينما تعتمد لوحات النصوص والبرمجة والمصادر المفتوحة وتوليد الصور والفيديو تقييمات التفضيل البشري المباشرة في Arena. يشارك تصنيف النماذج المحلية درجات النصوص المفتوحة ولا يمثل قياسًا لحجم ذاكرة VRAM. نلتزم بفصل تام بين المقاييس المختلفة.
ماذا توضح أشرطة الترتيب
يمتد طول الشريط نسبيًا من أدنى نموذج في القائمة وحتى المركز الأول (#1). الرقم المثبت على كل شريط هو نتيجة Arena الرسمية الدقيقة (نسبة التحسن IPS للوكلاء أو نقاط التقييم للوحات الأخرى). يعرض كل صف إجمالي المعارك أو الجلسات، إلى جانب تسعير التوكن وسعة نافذة السياق من models.dev. ترمز الألوان إلى الشركات المطورة للنماذج.
التزامات الشفافية
- نحن لا ننظم اختبارات تقييم ذاتية ولا ندعي إدارة معارك افتراضية خاصة بنا.
- لا نستخدم بيانات Artificial Analysis لتحديد ارتفاع الأشرطة أو حساب ترتيب النماذج.
- لا نخلط نتائج الوكلاء (Agent IPS) مع درجات النصوص أو الصور في لوحة واحدة إطلاقًا.
- لا ندعي تقديم معايير قياس VRAM للأجهزة الشخصية؛ لوحة النماذج المحلية تعرض النماذج المفتوحة نفسها.
- لا تتضمن النسخة الحالية أي تقديرات غير موثقة لحجم الاستخدام.
تصنيف النماذج المفتوحة
يُصنف النموذج كمفتوح المصدر إذا تم تمييزه بـ open_weights عبر models.dev أو إذا كان ترخيصه لا يندرج تحت البرمجيات المغلقة أو الاحتكارية، مع شمول التراخيص المفتوحة مجتمعيًا.