🎯 جهشی که اعداد آن را ثابت میکنند
وقتی گوگل از «بیش از دو برابر شدن» صحبت میکند، منظورش اغراق نیست. جمنای 3 پرو در همان آزمون ARC-AGI-2 امتیاز 31.1 درصد گرفته بود؛ جمنای 3.1 پرو این عدد را به 77.1 درصد رساند. ARC-AGI-2 آزمونی است که الگوهای منطقی کاملاً جدید را طراحی میکند تا مدل نتواند صرفاً از حفظیات خود استفاده کند، بلکه مجبور شود واقعاً «فکر» کند. این نتیجه از سوی تیم سازنده آزمون به صورت مستقل تأیید شده است.
با این حال، تصویر رقابتی پیچیدهتر از یک برندهی مطلق است. در آزمون GPQA Diamond که سؤالات دکترایی علوم را میسنجد، جمنای 3.1 پرو با امتیاز 94.3 درصد رکورد جهانی را شکست؛ GPT-5.2 قبلاً با 92.4 درصد این رکورد را داشت. در آزمون SWE-Bench برای کدنویسی اجنتیک نیز با 80.6 درصد تنها یک دهم درصد پشت سر کلود اوپوس 4.6 قرار دارد. اما در جداول ترجیح کاربران روی پلتفرم Arena، کلود اوپوس 4.6 همچنان در متننویسی و کدنویسی پیشتاز است.
💡 چرا این مدل «اجنتیک» است؟
جمنای 3.1 پرو بهخصوص برای کارهایی طراحی شده که یک پاسخ ساده کافی نیست. در واقع، گوگل یک endpoint اختصاصی به نام gemini-3.1-pro-preview-customtools هم برای توسعهدهندگان ارائه داده که برای ترکیب دستورات bash با توابع سفارشی بهینه شده. نسخههای قبلی اغلب در تشخیص اینکه کدام ابزار را چه زمانی باید صدا بزنند دچار اشتباه میشدند؛ این مشکل در 3.1 پرو به شکل چشمگیری کاهش یافته.
از نظر عملی، قابلیتهای اجنتیک مدل جهشی واقعی داشتهاند: BrowseComp (توانایی مرور وب به صورت خودکار) از 59.2 به 85.9 درصد رسیده و APEX-Agents از 18.4 به 33.5 درصد. این ارقام نشان میدهند که مدل نه فقط بهتر «حرف میزند»، بلکه بهتر «کار میکند».
🔧 قابلیتهای خلاقانه و فنی
جدا از بنچمارکها، جمنای 3.1 پرو چند قابلیت خاص را هم به همراه آورده. مدل میتواند مستقیماً انیمیشنهای SVG آمادهی وب را از یک متن ساده تولید کند؛ شبیهسازیهای سهبعدی با ردیابی دست در زمان واقعی بسازد؛ و دادههای پیچیده را به داشبوردهای تعاملی تبدیل کند. نرخ هالوسینیشن (خطای واقعینمایی) هم بر اساس آزمون AA-Omniscience از 88 به 50 درصد کاهش یافته؛ پیشرفت قابل توجهی که البته هنوز جای بهبود دارد.
پنجرهی زمینه 1 میلیون توکنی (ورودی) و 64 هزار توکنی (خروجی) حفظ شده، اما حد فایل آپلود API از 20 به 100 مگابایت افزایش یافته. حالا میتوان مستقیماً لینک یوتیوب داد تا مدل ویدیو را بدون نیاز به آپلود تماشا کند.
📌 در ایران هم آمد: تلنت AI و دستیار هوشمند سازمانی آرتین
خبر خوب برای کاربران فارسیزبان این است که جمنای 3.1 پرو به نرمافزارهای تلنت AI و دستیار هوشمند سازمانی آرتین هم اضافه شده. این یعنی کاربران داخلی میتوانند از قدرت استدلالی این مدل در محیطهای سازمانی و کاری خود بهره ببرند، بدون نیاز به دسترسی مستقیم به زیرساختهای گوگل. مجله تخصصی هوش مصنوعی آرتین این رویداد را نشانهای از شتاب واقعی در بومیسازی ابزارهای هوش مصنوعی پیشرفته برای بازار ایران میداند.
⚠️ یک نکتهی مهم
جمنای 3.1 پرو در حال حاضر در مرحلهی «پیشنمایش» است، نه نسخهی پایدار کامل. گوگل اعلام کرده که این مرحله برای اعتبارسنجی بیشتر، بهویژه پیش از گسترش در کارهای اجنتیک پیچیده، ضروری است. در بازاری که گوگل، آنتروپیک و اوپنایآی همه با سرعت بالا در حرکتند و GPT-5.3 هم بهزودی انتظار میرود، نتایج نهایی هنوز مشخص نیستند.
#Gemini31Pro #AI #GoogleAI #جمنای #هوش_مصنوعی #ARC_AGI #مدل_زبانی
مجله تخصصی هوش مصنوعی آرتین
🌐 artinmag.ir | 📱 @ArtinMag
📌 اگر این مطلب برای شما مفید بود، آن را با دوستان خود به اشتراک بگذارید. نظرات و پیشنهادات خود را در بخش دیدگاهها با ما در میان بگذارید و با لایک کردن از ما حمایت کنید!
🔔 برای دریافت آخرین اخبار و مقالات تخصصی هوش مصنوعی، عضو کانال مجله آرتین شوید.
