مدل هوش مصنوعی Maverick متا در بنچمارک‌های مستقل از رقبایش شکست خورد

مدل هوش مصنوعی Maverick از شرکت متا (Meta) که به‌عنوان یکی از نسخه‌های جدید و آزمایشی خانواده‌ی Llama 4 معرفی شد، این روزها به‌جای افتخار، بیشتر با انتقاد و حاشیه روبه‌رو شده است.

ماجرا از کجا شروع شد؟

در هفته گذشته مشخص شد متا برای کسب رتبه بالا در بنچمارک محبوب LM Arena، نه نسخه‌ی رسمی، بلکه نسخه‌ی آزمایشی و منتشرنشده‌ای از مدل Maverick را استفاده کرده است. این نسخه با نام Llama-4-Maverick-03-26-Experimental، مخصوص مکالمه‌ها بهینه‌سازی شده بود تا پاسخ‌های طبیعی‌تری در گفتگوها ارائه دهد.

در پلتفرم LM Arena، عملکرد مدل‌ها به‌صورت انسانی ارزیابی می‌شود؛ یعنی کاربران واقعی پاسخ مدل‌های مختلف را می‌خوانند و به بهترین پاسخ رأی می‌دهند. همین ویژگی باعث شد نسخه‌ی آزمایشی متا عملکرد درخشانی از خود نشان دهد، اما این موفقیت از دید بسیاری، غیراخلاقی و فریبنده تلقی شد.

واکنش LM Arena

پس از افشای این موضوع، پلتفرم LM Arena ضمن عذرخواهی رسمی، اعلام کرد از این پس تنها نسخه‌های رسمی و عمومی‌شده‌ی مدل‌ها در رتبه‌بندی نهایی لحاظ خواهند شد تا رقابت عادلانه باشد.

مقایسه با رقبا

نسخه‌ی رسمی مدل متا با نام کامل Llama-4-Maverick-17B-128E-Instruct، برخلاف نسخه‌ی آزمایشی، عملکرد ضعیف‌تری داشت و در رتبه‌ای پایین‌تر از مدل‌هایی مانند:

  • GPT-4o (OpenAI)

  • Claude 3.5 Sonnet (Anthropic)

  • Gemini 1.5 Pro (Google DeepMind)

قرار گرفت. این در حالی است که برخی از این مدل‌ها ماه‌ها قبل معرفی شده بودند.

دلیل عملکرد ضعیف نسخه رسمی

به‌گفته‌ی متا، نسخه‌ی رسمی Maverick هنوز برای استفاده عمومی بهینه نشده و در واقع نسخه‌ای کلی‌تر از مدل است که برخلاف نسخه‌ی آزمایشی، به‌صورت خاص برای مکالمه شخصی‌سازی نشده است. این تفاوت باعث شد تا Maverick اصلی نتواند در شرایط رقابتی واقعی، نظر کاربران را جلب کند.

نکته مهم درباره بنچمارک‌ها

این اتفاق بار دیگر نشان داد که بنچمارک‌های فعلی، به‌خصوص LM Arena، معیار دقیقی برای ارزیابی عملکرد کلی مدل‌های هوش مصنوعی نیستند. زیرا مدل‌ها ممکن است به‌صورت خاص برای درخشش در این رقابت‌ها آموزش ببینند و نه برای کاربردهای عمومی.

دیدگاهتان را بنویسید

نشانی ایمیل شما منتشر نخواهد شد. بخش‌های موردنیاز علامت‌گذاری شده‌اند *