مفارقة Google… خداع أم واقع الجميع؟
بتتبع إطلاق Google لنماذجها نجد أنه الأرقام تظهر كأنها أعادت ترتيب السباق:
- تفوق في البرمجة
- تقدم في الأمن السيبراني
- صدارة في سير العمل
ثم بالتجربة يظهر سؤال أبسط:
هل هذا النموذج الذي استخدمه هو نفسه الذي تظهر أرقامه المنشورة؟
آخر مثال قبل أيام….
Google أعلنت عن Gemini 4 Argon بنتائج تنافسية على اختبارات معتمدة….
في اليوم نفسه نقلت بلومبرغ عن موظفين داخل الشركة أن النموذج يؤدي أقل حين يُوضع على مهام حقيقية، خصوصاً البرمجة وتصميم الواجهات.
عصبت google وقالت هذا الكلام ما صحيح!
هنا تظهر المفارقة….
Google يمكن ما تكذب… ليش؟
لأن هناك فجوة منهجية صار اسمها في الصناعة benchmaxxing وتعني ضبط النموذج ليحصل على درجة عالية في الاختبار، أكثر من ضبطه لإنجاز عمل غير مرتب يطلبه مستخدم عادي.
وهذه الممارسات منتشرة عند معظم الشركات وتحدثت عنها من قبل:
- أرقام الإطلاق في الغالب هي لأفضل تشغيل وفي ظروف قياسية.
- بعض الاختبارات مشبعة أو قريبة من بيانات التدريب، فارتفاع النقطة لا يعني قفزة عملية (يعني النموذج تدرب على بعض ما في الاختبار)
- نافذة السياق الطويلة تُعرض كميزة، ب
بتتبع إطلاق Google لنماذجها نجد أنه الأرقام تظهر كأنها أعادت ترتيب السباق:
- تفوق في البرمجة
- تقدم في الأمن السيبراني
- صدارة في سير العمل
ثم بالتجربة يظهر سؤال أبسط:
هل هذا النموذج الذي استخدمه هو نفسه الذي تظهر أرقامه المنشورة؟
آخر مثال قبل أيام….
Google أعلنت عن Gemini 4 Argon بنتائج تنافسية على اختبارات معتمدة….
في اليوم نفسه نقلت بلومبرغ عن موظفين داخل الشركة أن النموذج يؤدي أقل حين يُوضع على مهام حقيقية، خصوصاً البرمجة وتصميم الواجهات.
عصبت google وقالت هذا الكلام ما صحيح!
هنا تظهر المفارقة….
Google يمكن ما تكذب… ليش؟
لأن هناك فجوة منهجية صار اسمها في الصناعة benchmaxxing وتعني ضبط النموذج ليحصل على درجة عالية في الاختبار، أكثر من ضبطه لإنجاز عمل غير مرتب يطلبه مستخدم عادي.
وهذه الممارسات منتشرة عند معظم الشركات وتحدثت عنها من قبل:
- أرقام الإطلاق في الغالب هي لأفضل تشغيل وفي ظروف قياسية.
- بعض الاختبارات مشبعة أو قريبة من بيانات التدريب، فارتفاع النقطة لا يعني قفزة عملية (يعني النموذج تدرب على بعض ما في الاختبار)
- نافذة السياق الطويلة تُعرض كميزة، ب