مدل هوش مصنوعی Maverick از شرکت متا (Meta) که بهعنوان یکی از نسخههای جدید و آزمایشی خانوادهی Llama 4 معرفی شد، این روزها بهجای افتخار، بیشتر با انتقاد و حاشیه روبهرو شده است.
ماجرا از کجا شروع شد؟
در هفته گذشته مشخص شد متا برای کسب رتبه بالا در بنچمارک محبوب LM Arena، نه نسخهی رسمی، بلکه نسخهی آزمایشی و منتشرنشدهای از مدل Maverick را استفاده کرده است. این نسخه با نام Llama-4-Maverick-03-26-Experimental، مخصوص مکالمهها بهینهسازی شده بود تا پاسخهای طبیعیتری در گفتگوها ارائه دهد.
در پلتفرم LM Arena، عملکرد مدلها بهصورت انسانی ارزیابی میشود؛ یعنی کاربران واقعی پاسخ مدلهای مختلف را میخوانند و به بهترین پاسخ رأی میدهند. همین ویژگی باعث شد نسخهی آزمایشی متا عملکرد درخشانی از خود نشان دهد، اما این موفقیت از دید بسیاری، غیراخلاقی و فریبنده تلقی شد.
واکنش LM Arena
پس از افشای این موضوع، پلتفرم LM Arena ضمن عذرخواهی رسمی، اعلام کرد از این پس تنها نسخههای رسمی و عمومیشدهی مدلها در رتبهبندی نهایی لحاظ خواهند شد تا رقابت عادلانه باشد.
مقایسه با رقبا
نسخهی رسمی مدل متا با نام کامل Llama-4-Maverick-17B-128E-Instruct، برخلاف نسخهی آزمایشی، عملکرد ضعیفتری داشت و در رتبهای پایینتر از مدلهایی مانند:
-
GPT-4o (OpenAI)
-
Claude 3.5 Sonnet (Anthropic)
-
Gemini 1.5 Pro (Google DeepMind)
قرار گرفت. این در حالی است که برخی از این مدلها ماهها قبل معرفی شده بودند.
دلیل عملکرد ضعیف نسخه رسمی
بهگفتهی متا، نسخهی رسمی Maverick هنوز برای استفاده عمومی بهینه نشده و در واقع نسخهای کلیتر از مدل است که برخلاف نسخهی آزمایشی، بهصورت خاص برای مکالمه شخصیسازی نشده است. این تفاوت باعث شد تا Maverick اصلی نتواند در شرایط رقابتی واقعی، نظر کاربران را جلب کند.
نکته مهم درباره بنچمارکها
این اتفاق بار دیگر نشان داد که بنچمارکهای فعلی، بهخصوص LM Arena، معیار دقیقی برای ارزیابی عملکرد کلی مدلهای هوش مصنوعی نیستند. زیرا مدلها ممکن است بهصورت خاص برای درخشش در این رقابتها آموزش ببینند و نه برای کاربردهای عمومی.