جمنای 3.1 پرو؛ جهشی دو برابری در استدلال هوش مصنوعی گوگل

مرتضی علیزاده
۱ اسفند ۱۴۰۴
64 بازدید
#Gemini31Pro #AI #GoogleAI #جمنای #هوش_مصنوعی #ARC_AGI #مدل_زبانی

🎯 جهشی که اعداد آن را ثابت می‌کنند

وقتی گوگل از «بیش از دو برابر شدن» صحبت می‌کند، منظورش اغراق نیست. جمنای 3 پرو در همان آزمون ARC-AGI-2 امتیاز 31.1 درصد گرفته بود؛ جمنای 3.1 پرو این عدد را به 77.1 درصد رساند. ARC-AGI-2 آزمونی است که الگوهای منطقی کاملاً جدید را طراحی می‌کند تا مدل نتواند صرفاً از حفظیات خود استفاده کند، بلکه مجبور شود واقعاً «فکر» کند. این نتیجه از سوی تیم سازنده آزمون به صورت مستقل تأیید شده است.

با این حال، تصویر رقابتی پیچیده‌تر از یک برنده‌ی مطلق است. در آزمون GPQA Diamond که سؤالات دکترایی علوم را می‌سنجد، جمنای 3.1 پرو با امتیاز 94.3 درصد رکورد جهانی را شکست؛ GPT-5.2 قبلاً با 92.4 درصد این رکورد را داشت. در آزمون SWE-Bench برای کدنویسی اجنتیک نیز با 80.6 درصد تنها یک دهم درصد پشت سر کلود اوپوس 4.6 قرار دارد. اما در جداول ترجیح کاربران روی پلتفرم Arena، کلود اوپوس 4.6 همچنان در متن‌نویسی و کدنویسی پیشتاز است.

💡 چرا این مدل «اجنتیک» است؟

جمنای 3.1 پرو به‌خصوص برای کارهایی طراحی شده که یک پاسخ ساده کافی نیست. در واقع، گوگل یک endpoint اختصاصی به نام gemini-3.1-pro-preview-customtools هم برای توسعه‌دهندگان ارائه داده که برای ترکیب دستورات bash با توابع سفارشی بهینه شده. نسخه‌های قبلی اغلب در تشخیص این‌که کدام ابزار را چه زمانی باید صدا بزنند دچار اشتباه می‌شدند؛ این مشکل در 3.1 پرو به شکل چشمگیری کاهش یافته.

از نظر عملی، قابلیت‌های اجنتیک مدل جهشی واقعی داشته‌اند: BrowseComp (توانایی مرور وب به صورت خودکار) از 59.2 به 85.9 درصد رسیده و APEX-Agents از 18.4 به 33.5 درصد. این ارقام نشان می‌دهند که مدل نه فقط بهتر «حرف می‌زند»، بلکه بهتر «کار می‌کند».

🔧 قابلیت‌های خلاقانه و فنی

جدا از بنچمارک‌ها، جمنای 3.1 پرو چند قابلیت خاص را هم به همراه آورده. مدل می‌تواند مستقیماً انیمیشن‌های SVG آماده‌ی وب را از یک متن ساده تولید کند؛ شبیه‌سازی‌های سه‌بعدی با ردیابی دست در زمان واقعی بسازد؛ و داده‌های پیچیده را به داشبوردهای تعاملی تبدیل کند. نرخ هالوسینیشن (خطای واقعی‌نمایی) هم بر اساس آزمون AA-Omniscience از 88 به 50 درصد کاهش یافته؛ پیشرفت قابل توجهی که البته هنوز جای بهبود دارد.

پنجره‌ی زمینه 1 میلیون توکنی (ورودی) و 64 هزار توکنی (خروجی) حفظ شده، اما حد فایل آپلود API از 20 به 100 مگابایت افزایش یافته. حالا می‌توان مستقیماً لینک یوتیوب داد تا مدل ویدیو را بدون نیاز به آپلود تماشا کند.

📌 در ایران هم آمد: تلنت AI و دستیار هوشمند سازمانی آرتین

خبر خوب برای کاربران فارسی‌زبان این است که جمنای 3.1 پرو به نرم‌افزارهای تلنت AI و دستیار هوشمند سازمانی آرتین هم اضافه شده. این یعنی کاربران داخلی می‌توانند از قدرت استدلالی این مدل در محیط‌های سازمانی و کاری خود بهره ببرند، بدون نیاز به دسترسی مستقیم به زیرساخت‌های گوگل. مجله تخصصی هوش مصنوعی آرتین این رویداد را نشانه‌ای از شتاب واقعی در بومی‌سازی ابزارهای هوش مصنوعی پیشرفته برای بازار ایران می‌داند.

⚠️ یک نکته‌ی مهم

جمنای 3.1 پرو در حال حاضر در مرحله‌ی «پیش‌نمایش» است، نه نسخه‌ی پایدار کامل. گوگل اعلام کرده که این مرحله برای اعتبارسنجی بیشتر، به‌ویژه پیش از گسترش در کارهای اجنتیک پیچیده، ضروری است. در بازاری که گوگل، آنتروپیک و اوپن‌ای‌آی همه با سرعت بالا در حرکتند و GPT-5.3 هم به‌زودی انتظار می‌رود، نتایج نهایی هنوز مشخص نیستند.

#Gemini31Pro #AI #GoogleAI #جمنای #هوش_مصنوعی #ARC_AGI #مدل_زبانی

مجله تخصصی هوش مصنوعی آرتین
🌐 artinmag.ir | 📱 @ArtinMag

📌 اگر این مطلب برای شما مفید بود، آن را با دوستان خود به اشتراک بگذارید. نظرات و پیشنهادات خود را در بخش دیدگاه‌ها با ما در میان بگذارید و با لایک کردن از ما حمایت کنید!

🔔 برای دریافت آخرین اخبار و مقالات تخصصی هوش مصنوعی، عضو کانال مجله آرتین شوید.

اشتراک‌گذاری