Claude Opus 4.5؛ آنتروپیک تاج کدنویسی را بازپس می‌گیرد

مرتضی علیزاده
۴ آذر ۱۴۰۴
8 بازدید
Claude Opus 4.5؛ آنتروپیک تاج کدنویسی را بازپس می‌گیرد
ClaudeOpus45آنتروپیکهوش_مصنوعیکدنویسیAI_CodingSWE_BenchAnthropic

خلاصه

آنتروپیک با Opus 4.5 به صدر برمی‌گردد

در تاریخ 24 نوامبر 2025، شرکت آنتروپیک اعلام کرد که مدل Claude Opus 4.5 را به‌عنوان جدیدترین عضو خانواده مدل‌های کلاد عرضه کرده است. این مدل سومین راه‌اندازی بزرگ آنتروپیک در دو ماه گذشته محسوب می‌شود و پس از Sonnet 4.5 (سپتامبر) و Haiku 4.5 (اکتبر) معرفی شده است. به نظر می‌رسد آنتروپیک با این اقدام می‌خواهد جایگاه خود را در بازار پرشتاب هوش مصنوعی تثبیت کند.

Opus 4.5 با ویژگی‌های برجسته‌ای همراه است: پنجره زمینه 200 هزار توکن، محدودیت خروجی 64 هزار توکن، و دانش قابل اعتماد تا مارس 2025. اما شاید مهم‌ترین جنبه این مدل، قیمت‌گذاری جدید آن باشد. قیمت ورودی 5 دلار به ازای هر میلیون توکن و خروجی 25 دلار تعیین شده که نسبت به نسخه قبلی Opus (15/75 دلار) بسیار مقرون‌به‌صرفه‌تر است. این موضوع برای کاربران تیمی و سازمانی اهمیت زیادی دارد، چرا که هزینه استفاده از قدرتمندترین مدل‌ها را کاهش می‌دهد.

رکوردشکنی در بنچمارک‌های کدنویسی

آنچه Opus 4.5 را از رقبا متمایز می‌کند، عملکرد استثنایی آن در بنچمارک‌های دنیای واقعی است. مجله تخصصی هوش مصنوعی آرتین در بررسی نتایج این مدل دریافت که امتیاز 80.9 درصدی در SWE-Bench Verified یک دستاورد بی‌سابقه است. این بنچمارک، که توسط OpenAI و نویسندگان اصلی SWE-bench راه‌اندازی شد، شامل 500 مسئله واقعی از مخازن گیت‌هاب است که توسط مهندسان نرم‌افزار انسانی تایید شده‌اند.

در واقع، SWE-Bench Verified به این دلیل طراحی شد که ارزیابی دقیق‌تری از توانایی مدل‌ها در حل مشکلات نرم‌افزاری واقعی ارائه دهد. هر نمونه در این بنچمارک از یک ایشوی واقعی گیت‌هاب در یکی از 12 مخزن محبوب پایتون گرفته شده است. مدل باید فایل‌های مناسب را در مخزن تغییر دهد تا مشکل حل شود، سپس راه‌حل با اجرای تست‌های واحد ارزیابی می‌شود.

Opus 4.5 همچنین در Terminal-bench، tau2-bench، MCP Atlas و ARC-AGI 2 نیز رتبه‌های برتر را کسب کرده است. این عملکرد نشان می‌دهد که مدل نه‌تنها در کدنویسی بلکه در استفاده از ابزارها و حل مسائل پیچیده نیز توانمندی بالایی دارد.

رقابت سخت با غول‌های فناوری

با این حال، آنتروپیک در بازاری رقابتی فعالیت می‌کند. در هفته‌های اخیر، OpenAI مدل GPT-5.1 و گوگل مدل Gemini 3 را عرضه کردند که هر دو ادعای برتری داشتند. گمینی 3 به‌ویژه توانست تحسین زیادی به دست آورد و حتی مارک بنیوف، مدیرعامل سیلزفورس، اعلام کرد که چت‌جی‌پی‌تی را کنار گذاشته و به گمینی روی آورده است. این اظهارنظر باعث افزایش بیش از 6 درصدی سهام آلفابت (شرکت مادر گوگل) شد.

اما آیا Opus 4.5 واقعاً بهترین است؟ بر اساس داده‌های رسمی، پاسخ مثبت است – حداقل در بنچمارک‌های کدنویسی. آنتروپیک در آزمایشی جالب، یک امتحان کاربردی سخت که برای استخدام مهندسان عملکرد خود استفاده می‌کند را به Opus 4.5 داد. این امتحان دو ساعت زمان دارد و Opus 4.5 نمره‌ای بالاتر از هر کاندیدای انسانی که تاکنون در آن شرکت کرده کسب کرد. این موضوع نشان می‌دهد که مرز میان توانایی انسان و ماشین در کدنویسی به‌سرعت در حال تغییر است.

ویژگی‌های جدید برای کاربران

آنتروپیک در کنار Opus 4.5، محصولات و قابلیت‌های جدیدی را نیز معرفی کرد:

Claude for Chrome: این افزونه مرورگر که قبلاً در مرحله پایلوت بود، اکنون برای تمام کاربران Max در دسترس است. این ابزار به کلاد اجازه می‌دهد وظایفی را در تب‌های مختلف مرورگر انجام دهد.

Claude for Excel: دسترسی بتا به این ابزار برای کاربران Max، Team و Enterprise گسترش یافته است. Opus 4.5 در ایجاد صفحات گسترده، اسلایدها و اسناد با کیفیت، ثبات و آگاهی حرفه‌ای عملکرد قوی نشان می‌دهد.

گفتگوهای بی‌پایان: یکی از مشکلات قدیمی کاربران کلاد، محدودیت طول گفتگو بود. با Opus 4.5، کلاد به‌طور خودکار زمینه قبلی را خلاصه می‌کند تا گفتگو بدون وقفه ادامه یابد.

Claude Code بهبود‌یافته: نسخه دسکتاپ Claude Code اکنون با حالت طرح‌ریزی ارتقایافته ارائه می‌شود که طرح‌های دقیق‌تری ایجاد کرده و قبل از اجرا، یک فایل plan.md قابل ویرایش توسط کاربر می‌سازد.

چشم‌انداز آینده

ارزشیابی آنتروپیک اخیراً به 350 میلیارد دلار رسیده است، که نشان‌دهنده سرمایه‌گذاری‌های عظیم مایکروسافت و انویدیا در این شرکت است. این رقم نسبت به 183 میلیارد دلار در سپتامبر افزایش چشمگیری داشته است. بر اساس گزارش وال‌استریت جورنال، آنتروپیک قرار است تا سال 2028 به نقطه سربه‌سر برسد، در حالی که OpenAI این هدف را برای 2030 تعیین کرده است.

با این حال، سوالات مهمی باقی می‌ماند: آیا عملکرد برتر در بنچمارک‌ها به معنای برتری در دنیای واقعی است؟ آیا توسعه‌دهندگان از Opus 4.5 در پروژه‌های تجاری استفاده خواهند کرد؟ پاسخ به این سوالات در ماه‌های آینده مشخص خواهد شد، زمانی که کاربران واقعی این مدل را در محیط‌های کاری خود آزمایش کنند.

یکی از نکات جالب در مورد Opus 4.5 این است که با وجود قدرت بالا، هنوز هم در برخی سناریوها نمی‌تواند جایگزین کامل Sonnet 4.5 یا Haiku 4.5 شود. الکس آلبرت، رئیس روابط توسعه‌دهندگان در آنتروپیک، توضیح داد: "جالب آنکه این ریلیز لزوماً به این معنی نیست که همه باید به Opus تغییر مسیر دهند، بلکه سطح جدیدی از امکانات را فعال می‌کند. اکنون سه مدل داریم که هر کدام نیازهای متفاوتی را در این منحنی پوشش می‌دهند."

آیا هوش مصنوعی می‌تواند جایگزین برنامه‌نویسان شود؟

نتیجه Opus 4.5 در امتحان استخدام آنتروپیک سوال مهمی را مطرح می‌کند: آیا مدل‌های هوش مصنوعی در حال نزدیک شدن به جایگزینی کامل برنامه‌نویسان انسانی هستند؟ پاسخ پیچیده است. درست است که Opus 4.5 در تست‌های محدود و ساختاریافته عملکرد خوبی دارد، اما هنوز چالش‌های زیادی باقی مانده است.

مثلاً، در بنچمارک SWE-Bench Pro جدید که توسط شرکت Scale عرضه شده، عملکرد مدل‌های پیشرفته به‌شدت کاهش یافته است. در حالی که بیشتر مدل‌های برتر در SWE-Bench Verified بیش از 70 درصد امتیاز می‌گیرند، بهترین مدل‌ها مانند GPT-5 و Opus 4.1 در SWE-Bench Pro تنها 23.3 و 23.1 درصد امتیاز کسب کردند. این موضوع نشان می‌دهد که مدل‌ها هنوز در کدهای پیچیده‌تر و ناآشناتر مشکل دارند.

با این وجود، توسعه‌دهندگانی که Opus 4.5 را آزمایش کرده‌اند، از آن به عنوان یک "گام معنادار به جلو" یاد کرده‌اند. آن‌ها می‌گویند که مدل "موضوع را می‌فهمد" و قادر است ابهامات را مدیریت کرده و درباره تصمیمات پیچیده استدلال کند، بدون نیاز به راهنمایی دقیق.

مجله تخصصی هوش مصنوعی آرتین

🔗 بیشتر بخوانید: آینده هوش مصنوعی در کدنویسی

📌 اگر این مطلب برای شما مفید بود، آن را با دوستان خود به اشتراک بگذارید. نظرات و پیشنهادات خود را در بخش دیدگاه‌ها با ما در میان بگذارید و با لایک کردن از ما حمایت کنید!

🔔 برای دریافت آخرین اخبار و مقالات تخصصی هوش مصنوعی، عضو کانال @ArtinMag شوید.

 

آنتروپیک با Opus 4.5 به صدر برمی‌گردد

در تاریخ 24 نوامبر 2025، شرکت آنتروپیک اعلام کرد که مدل Claude Opus 4.5 را به‌عنوان جدیدترین عضو خانواده مدل‌های کلاد عرضه کرده است. این مدل سومین راه‌اندازی بزرگ آنتروپیک در دو ماه گذشته محسوب می‌شود و پس از Sonnet 4.5 (سپتامبر) و Haiku 4.5 (اکتبر) معرفی شده است. به نظر می‌رسد آنتروپیک با این اقدام می‌خواهد جایگاه خود را در بازار پرشتاب هوش مصنوعی تثبیت کند.

Opus 4.5 با ویژگی‌های برجسته‌ای همراه است: پنجره زمینه 200 هزار توکن، محدودیت خروجی 64 هزار توکن، و دانش قابل اعتماد تا مارس 2025. اما شاید مهم‌ترین جنبه این مدل، قیمت‌گذاری جدید آن باشد. قیمت ورودی 5 دلار به ازای هر میلیون توکن و خروجی 25 دلار تعیین شده که نسبت به نسخه قبلی Opus (15/75 دلار) بسیار مقرون‌به‌صرفه‌تر است. این موضوع برای کاربران تیمی و سازمانی اهمیت زیادی دارد، چرا که هزینه استفاده از قدرتمندترین مدل‌ها را کاهش می‌دهد.

رکوردشکنی در بنچمارک‌های کدنویسی

آنچه Opus 4.5 را از رقبا متمایز می‌کند، عملکرد استثنایی آن در بنچمارک‌های دنیای واقعی است. مجله تخصصی هوش مصنوعی آرتین در بررسی نتایج این مدل دریافت که امتیاز 80.9 درصدی در SWE-Bench Verified یک دستاورد بی‌سابقه است. این بنچمارک، که توسط OpenAI و نویسندگان اصلی SWE-bench راه‌اندازی شد، شامل 500 مسئله واقعی از مخازن گیت‌هاب است که توسط مهندسان نرم‌افزار انسانی تایید شده‌اند.

در واقع، SWE-Bench Verified به این دلیل طراحی شد که ارزیابی دقیق‌تری از توانایی مدل‌ها در حل مشکلات نرم‌افزاری واقعی ارائه دهد. هر نمونه در این بنچمارک از یک ایشوی واقعی گیت‌هاب در یکی از 12 مخزن محبوب پایتون گرفته شده است. مدل باید فایل‌های مناسب را در مخزن تغییر دهد تا مشکل حل شود، سپس راه‌حل با اجرای تست‌های واحد ارزیابی می‌شود.

Opus 4.5 همچنین در Terminal-bench، tau2-bench، MCP Atlas و ARC-AGI 2 نیز رتبه‌های برتر را کسب کرده است. این عملکرد نشان می‌دهد که مدل نه‌تنها در کدنویسی بلکه در استفاده از ابزارها و حل مسائل پیچیده نیز توانمندی بالایی دارد.

رقابت سخت با غول‌های فناوری

با این حال، آنتروپیک در بازاری رقابتی فعالیت می‌کند. در هفته‌های اخیر، OpenAI مدل GPT-5.1 و گوگل مدل Gemini 3 را عرضه کردند که هر دو ادعای برتری داشتند. گمینی 3 به‌ویژه توانست تحسین زیادی به دست آورد و حتی مارک بنیوف، مدیرعامل سیلزفورس، اعلام کرد که چت‌جی‌پی‌تی را کنار گذاشته و به گمینی روی آورده است. این اظهارنظر باعث افزایش بیش از 6 درصدی سهام آلفابت (شرکت مادر گوگل) شد.

اما آیا Opus 4.5 واقعاً بهترین است؟ بر اساس داده‌های رسمی، پاسخ مثبت است – حداقل در بنچمارک‌های کدنویسی. آنتروپیک در آزمایشی جالب، یک امتحان کاربردی سخت که برای استخدام مهندسان عملکرد خود استفاده می‌کند را به Opus 4.5 داد. این امتحان دو ساعت زمان دارد و Opus 4.5 نمره‌ای بالاتر از هر کاندیدای انسانی که تاکنون در آن شرکت کرده کسب کرد. این موضوع نشان می‌دهد که مرز میان توانایی انسان و ماشین در کدنویسی به‌سرعت در حال تغییر است.

ویژگی‌های جدید برای کاربران

آنتروپیک در کنار Opus 4.5، محصولات و قابلیت‌های جدیدی را نیز معرفی کرد:

Claude for Chrome: این افزونه مرورگر که قبلاً در مرحله پایلوت بود، اکنون برای تمام کاربران Max در دسترس است. این ابزار به کلاد اجازه می‌دهد وظایفی را در تب‌های مختلف مرورگر انجام دهد.

Claude for Excel: دسترسی بتا به این ابزار برای کاربران Max، Team و Enterprise گسترش یافته است. Opus 4.5 در ایجاد صفحات گسترده، اسلایدها و اسناد با کیفیت، ثبات و آگاهی حرفه‌ای عملکرد قوی نشان می‌دهد.

گفتگوهای بی‌پایان: یکی از مشکلات قدیمی کاربران کلاد، محدودیت طول گفتگو بود. با Opus 4.5، کلاد به‌طور خودکار زمینه قبلی را خلاصه می‌کند تا گفتگو بدون وقفه ادامه یابد.

Claude Code بهبود‌یافته: نسخه دسکتاپ Claude Code اکنون با حالت طرح‌ریزی ارتقایافته ارائه می‌شود که طرح‌های دقیق‌تری ایجاد کرده و قبل از اجرا، یک فایل plan.md قابل ویرایش توسط کاربر می‌سازد.

چشم‌انداز آینده

ارزشیابی آنتروپیک اخیراً به 350 میلیارد دلار رسیده است، که نشان‌دهنده سرمایه‌گذاری‌های عظیم مایکروسافت و انویدیا در این شرکت است. این رقم نسبت به 183 میلیارد دلار در سپتامبر افزایش چشمگیری داشته است. بر اساس گزارش وال‌استریت جورنال، آنتروپیک قرار است تا سال 2028 به نقطه سربه‌سر برسد، در حالی که OpenAI این هدف را برای 2030 تعیین کرده است.

با این حال، سوالات مهمی باقی می‌ماند: آیا عملکرد برتر در بنچمارک‌ها به معنای برتری در دنیای واقعی است؟ آیا توسعه‌دهندگان از Opus 4.5 در پروژه‌های تجاری استفاده خواهند کرد؟ پاسخ به این سوالات در ماه‌های آینده مشخص خواهد شد، زمانی که کاربران واقعی این مدل را در محیط‌های کاری خود آزمایش کنند.

یکی از نکات جالب در مورد Opus 4.5 این است که با وجود قدرت بالا، هنوز هم در برخی سناریوها نمی‌تواند جایگزین کامل Sonnet 4.5 یا Haiku 4.5 شود. الکس آلبرت، رئیس روابط توسعه‌دهندگان در آنتروپیک، توضیح داد: "جالب آنکه این ریلیز لزوماً به این معنی نیست که همه باید به Opus تغییر مسیر دهند، بلکه سطح جدیدی از امکانات را فعال می‌کند. اکنون سه مدل داریم که هر کدام نیازهای متفاوتی را در این منحنی پوشش می‌دهند."

آیا هوش مصنوعی می‌تواند جایگزین برنامه‌نویسان شود؟

نتیجه Opus 4.5 در امتحان استخدام آنتروپیک سوال مهمی را مطرح می‌کند: آیا مدل‌های هوش مصنوعی در حال نزدیک شدن به جایگزینی کامل برنامه‌نویسان انسانی هستند؟ پاسخ پیچیده است. درست است که Opus 4.5 در تست‌های محدود و ساختاریافته عملکرد خوبی دارد، اما هنوز چالش‌های زیادی باقی مانده است.

مثلاً، در بنچمارک SWE-Bench Pro جدید که توسط شرکت Scale عرضه شده، عملکرد مدل‌های پیشرفته به‌شدت کاهش یافته است. در حالی که بیشتر مدل‌های برتر در SWE-Bench Verified بیش از 70 درصد امتیاز می‌گیرند، بهترین مدل‌ها مانند GPT-5 و Opus 4.1 در SWE-Bench Pro تنها 23.3 و 23.1 درصد امتیاز کسب کردند. این موضوع نشان می‌دهد که مدل‌ها هنوز در کدهای پیچیده‌تر و ناآشناتر مشکل دارند.

با این وجود، توسعه‌دهندگانی که Opus 4.5 را آزمایش کرده‌اند، از آن به عنوان یک "گام معنادار به جلو" یاد کرده‌اند. آن‌ها می‌گویند که مدل "موضوع را می‌فهمد" و قادر است ابهامات را مدیریت کرده و درباره تصمیمات پیچیده استدلال کند، بدون نیاز به راهنمایی دقیق.

مجله تخصصی هوش مصنوعی آرتین

🔗 بیشتر بخوانید: آینده هوش مصنوعی در کدنویسی

📌 اگر این مطلب برای شما مفید بود، آن را با دوستان خود به اشتراک بگذارید. نظرات و پیشنهادات خود را در بخش دیدگاه‌ها با ما در میان بگذارید و با لایک کردن از ما حمایت کنید!

🔔 برای دریافت آخرین اخبار و مقالات تخصصی هوش مصنوعی، عضو کانال @ArtinMag شوید.

 

اشتراک‌گذاری