مرور بنچمارک‌های GPT-6 Astra؛ آیا مدل جدید OpenAI واقعاً از رقبا بهتر است؟

آیا مدل جدید OpenAI از Fable 5 بهتر است؟
فهرست مطالب

وقتی روز پنج‌شنبه مدل GPT-6 Astra معرفی شد، امتیازهای آن در بنچمارک‌های مختلف بسیار خبرساز شد؛ برای مثال امتیاز ۹۹.۹ درصدی در ARC-AGI-3 گمانه‌زنی درباره رسیدن به هوش جامع مصنوعی را افزایش داد. بااین‌حال، بررسی نتایج مستقل نشان می‌دهد مدل استرا در همه زمینه‌ها برتری یکسانی ندارد. در شاخص هوش Artificial Analysis، این مدل در نسخه ارزیابی منتشرشده هم‌سطح GPT-5.6 Sol و پایین‌تر از Claude Fable 5.1 قرار گرفت. در ادامه نگاه دقیق‌تری به بنچمارک این مدل می‌اندازیم.

مدل GPT-6 Astra همان AGI است؟

مهم‌ترین امتیاز زمان معرفی Astra، امتیاز ۹۹.۹ درصدی در ARC-AGI-3 بود. OpenAI نیز در صفحه معرفی این مدل همین عدد را به‌عنوان یکی از نتایج اصلی Astra برجسته کرده است.

مرور بنچمارک‌های GPT-6 Astra؛ آیا مدل جدید OpenAI واقعاً از رقبا بهتر است؟
ARC-AGI-3 توانایی مدل در یادگیری و حل مسئله‌های جدید در محیط‌های تعاملی را ارزیابی می‌کند.

اما اگر استرا را در شرایط متفاوت آزمایش کنیم چه؟ در هارنس استاندارد و مستقل از ارائه‌دهنده، Astra با بالاترین سطح استدلال به امتیاز ۶۲.۷ درصد رسید و هزینه اجرای آزمون حدود ۲۶٬۰۹۸ دلار بود. در مقابل، هارنس اختصاصی امتیاز ۹۹.۹ درصد را با هزینه حدود ۱۸٬۸۱۷ دلار ثبت کرد.

البته هر دو عدد واقعی هستند، اما پاسخ دو سؤال متفاوت را می‌دهند. امتیاز ۶۲.۷ درصد برای مقایسه مدل‌ها در یک محیط استاندارد اهمیت بیشتری دارد، درحالی‌که عدد ۹۹.۹ درصد نشان می‌دهد Astra در شرایطی که بتواند از سازوکارهای اختصاصی استفاده کند، چه عملکردی دارد.

همچنین کارشناسان می‌گویند امتیاز بالا در ARC-AGI-3 به‌تنهایی اثبات‌کننده دستیابی به AGI نیست. این آزمون دامنه‌ای مشخص، محیط‌هایی بسته و اهدافی معین دارد و نمی‌تواند پیچیدگی و بازبودن مسائل دنیای واقعی را به‌طور کامل بازنمایی کند.

Astra در کدنویسی قوی است، اما رقیبان را کنار نمی‌زند

در بنچمارک‌های کدنویسی، عملکرد Astra به زمینه آزمون وابستگی زیادی دارد.

مرور بنچمارک‌های GPT-6 Astra؛ آیا مدل جدید OpenAI واقعاً از رقبا بهتر است؟
Terminal-Bench 4.0 توانایی مدل در انجام وظایف پیچیده و چندمرحله‌ای در محیط ترمینال را می‌سنجد.

بزرگ‌ترین برتری Astra در Terminal-Bench 4.0 دیده می‌شود؛ آزمونی که کارهای پیچیده مبتنی‌بر ترمینال، مهندسی نرم‌افزار، پیکربندی سیستم و تحلیل داده را ارزیابی می‌کند. Astra در این آزمون امتیاز ۵۷.۹ درصد به دست آورده است، درحالی‌که GPT-5.6 Sol به ۳۷.۳ درصد و مدل Claude Fable 5.1 به ۵۵.۸ درصد رسیده‌اند. OpenAI همچنین می‌گوید هزینه تخمینی API برای Astra در پیکربندی آزمایش‌شده حدود ۹ درصد کمتر از Sol و ۶۳ درصد کمتر از Fable 5.1 بوده است.

مرور بنچمارک‌های GPT-6 Astra؛ آیا مدل جدید OpenAI واقعاً از رقبا بهتر است؟
DeepSWE توانایی ایجنت هوش مصنوعی در حل مسائل واقعی مهندسی نرم‌افزار و کدنویسی را ارزیابی می‌کند.

در DeepSWE فاصله بسیار کمتر می‌شود. Astra امتیاز ۷۴.۱ درصد دارد؛ در برابر ۷۲.۷ درصد برای Sol، ۷۳.۷ درصد برای Claude Opus 5 و ۷۳.۸ درصد برای Gemini 3.8 Flash. بنابراین Astra در این آزمون نسبت به نسل قبلی خود پیشرفت کرده، اما فاصله آن با برخی مدل‌های رقیب بسیار محدود است.

مرور بنچمارک‌های GPT-6 Astra؛ آیا مدل جدید OpenAI واقعاً از رقبا بهتر است؟
FrontierCode 1.1 توانایی مدل در حل مسائل دشوار برنامه‌نویسی و تولید کد را می‌سنجد.

در FrontierCode 1.1 Extended نیز Astra با امتیاز ۶۴.۵ درصد بالاتر از Sol با ۶۰.۶ درصد قرار می‌گیرد، اما Claude Fable 5 با ۶۴.۹ درصد اندکی بالاتر است و Fable 5.1 با ۶۳.۶ درصد تقریباً در همان محدوده قرار دارد. در نسخه اصلی FrontierCode نیز Astra با ۵۳.۳ درصد، اندکی بالاتر از Fable 5.1 با ۵۰.۹ درصد قرار دارد، اما Fable 5 به ۵۳.۵ درصد رسیده است.

مرور بنچمارک‌های GPT-6 Astra؛ آیا مدل جدید OpenAI واقعاً از رقبا بهتر است؟
این بنچمارک عملکرد مدل‌ها را در وظایف ایجنت‌محور کدنویسی با ترکیبی از چند ارزیابی مقایسه می‌کند.

تصویر ترکیبی‌تر در Artificial Analysis Coding Agent Index دیده می‌شود. Astra در نسخه ۱.۴ این شاخص امتیاز ۶۷ گرفته است، درحالی‌که Fable 5.1 امتیاز ۷۰ دارد. بااین‌حال، Artificial Analysis می‌گوید Astra در مقایسه با Sol بسیار کم‌مصرف‌تر است و در سطح بیشینه استدلال، تقریباً با هزینه‌ای مشابه Sol امتیاز بالاتری به دست می‌آورد. در مقایسه با Fable 5، هزینه هر وظیفه برای Astra کمتر از نصف گزارش شده است.

در نتیجه، اگر معیار فقط «بهترین مدل کدنویسی» باشد، بنچمارک‌ها برتری قاطعی برای Astra نشان نمی‌دهند. اما اگر تعداد توکن مصرف‌شده و هزینه تکمیل یک وظیفه را نیز وارد معادله کنیم، Astra وضعیت بهتری پیدا می‌کند.

نقطه قوت اصلی GPT-6 Astra در کارهای ایجنت‌محور

یکی از روشن‌ترین الگوها در نتایج Astra، عملکرد آن در استفاده از کامپیوتر و اجرای وظایف چندمرحله‌ای است.

مرور بنچمارک‌های GPT-6 Astra؛ آیا مدل جدید OpenAI واقعاً از رقبا بهتر است؟
OSWorld 2.0 توانایی مدل در کنترل کامپیوتر و انجام وظایف واقعی در محیط‌های دسکتاپ را می‌سنجد.

در OSWorld 2.0 استرا امتیاز ۷۲.۶ درصد کسب کرده است؛ در مقایسه با ۶۵.۷ درصد برای GPT-5.6 Sol و ۷۰.۲ درصد برای Claude Opus 5. اوپن‌ای‌آی همچنین می‌گوید Astra در شبیه‌سازی‌های میزان تأخیر این آزمون، با حدود ۴۰ دقیقه برای هر وظیفه به این نتیجه رسیده، درحالی‌که Sol حدود ۷۵ دقیقه زمان نیاز داشته است.

مرور بنچمارک‌های GPT-6 Astra؛ آیا مدل جدید OpenAI واقعاً از رقبا بهتر است؟
ScreenSpot-Pro توانایی مدل در تشخیص و تعامل دقیق با عناصر رابط کاربری را ارزیابی می‌کند.

در ScreenSpot-Pro نیز Astra با ۹۲.۷ درصد، جهش قابل‌توجهی نسبت به امتیاز ۷۶.۹ درصدی Sol نشان می‌دهد. در AutomationBench هم امتیاز استرا به ۴۱.۴ درصد رسیده، درحالی‌که Sol امتیاز ۱۸.۱ درصد و Fable 5.1 امتیاز ۳۱.۴ درصد دارد.

این نتایج با توضیح OpenAI درباره معماری استفاده از مدل همخوانی دارد. Astra برای انجام کارهایی طراحی شده که صرفاً پاسخ متنی نیستند و شامل تعامل با نرم‌افزار، مرور محیط، اجرای دستورات، اصلاح خطا و ادامه یک فرایند چندمرحله‌ای می‌شوند.

در استدلال عمومی، جهش Astra آن‌قدر بزرگ نیست

اگر معیار را از کارهای ایجنت‌محور به یک شاخص ترکیبی از توانایی‌های مختلف تغییر دهیم، داستان متفاوت می‌شود.

مرور بنچمارک‌های GPT-6 Astra؛ آیا مدل جدید OpenAI واقعاً از رقبا بهتر است؟

در Artificial Analysis Intelligence Index نسخه ۴.۱.۱، استرا امتیاز ۶۱.۲ گرفته است؛ درحالی‌که GPT-5.6 Sol امتیاز ۶۰.۹، مدل Claude Fable 5.1 امتیاز ۶۵.۷ و Claude Fable 5 امتیاز ۶۲.۱ دارند. Claude Opus 5 نیز امتیاز ۶۳.۱ ثبت کرده است.

در همین ارزیابی، Astra با حدود ۱۰ درصد خروجی کمتر از Sol در سطح بیشینه استدلال، از نظر مصرف توکن کارآمدتر بود، اما افزایش قیمت باعث شد هزینه هر وظیفه در سطح بیشینه حدود ۷۵ درصد بیشتر شود.

این شاخص البته تمام توانایی‌های Astra را به یک عدد تبدیل می‌کند و به همین دلیل نمی‌تواند همه تفاوت‌های مدل را نشان دهد. بااین‌حال، نتیجه آن یک نکته مهم را روشن می‌کند: افزایش شدید عملکرد در بعضی آزمون‌ها الزاماً به معنای جهش مشابه در میانگین توانایی‌های مدل نیست.

Astra در برخی آزمون‌ها بهتر و در برخی دیگر ضعیف‌تر است

نتایج OpenAI نشان می‌دهد پیشرفت Astra در همه ارزیابی‌ها یک‌طرفه نیست.

مرور بنچمارک‌های GPT-6 Astra؛ آیا مدل جدید OpenAI واقعاً از رقبا بهتر است؟
BrowseComp توانایی مدل در جست‌وجو و یافتن اطلاعات دشوار و پراکنده در وب را ارزیابی می‌کند.

در BrowseComp، امتیاز Astra به ۹۱.۵ درصد رسیده، درحالی‌که Sol امتیاز ۹۰.۴ درصد دارد. در GPQA Diamond نیز Astra با ۹۶ درصد بالاتر از Sol با ۹۴.۶ درصد قرار می‌گیرد. در FrontierMath Tier 4 نسخه دوم، Astra به ۹۷.۶ درصد رسیده است، در برابر ۸۳ درصد برای Sol و ۸۷.۸ درصد برای Fable 5.1.

مرور بنچمارک‌های GPT-6 Astra؛ آیا مدل جدید OpenAI واقعاً از رقبا بهتر است؟
Humanity’s Last Exam دانش و توانایی استدلال مدل را در پرسش‌های دشوار حوزه‌هایی مانند علوم، ریاضیات و علوم انسانی ارزیابی می‌کند.

در مقابل، Humanity’s Last Exam با ابزارها تصویری متفاوت ارائه می‌کند. Astra در این آزمون ۵۷.۲ درصد گرفته، درحالی‌که Fable 5.1 به ۶۵ درصد رسیده است.

Artificial Analysis همچنین از افت Astra در GDPval-AA v2 و کاهش ۲ تا ۳ امتیازی در برخی ارزیابی‌های دیگر خبر داده است. در مقابل، این مؤسسه افزایش حدود ۸۰ امتیازی Astra در AA-Briefcase را گزارش کرده است؛ آزمونی که برای ارزیابی کارهای دانش‌محور ایجنتی در پروژه‌های طولانی طراحی شده است.

این تضاد مهم است. Astra در برخی وظایف طولانی و چندمرحله‌ای بهتر عمل می‌کند، اما در شاخص‌های ترکیبی یا برخی وظایف مشخص، این پیشرفت به همان اندازه دیده نمی‌شود.

مصرف توکن، برگ برنده مدل Astra در برابر قیمت بالاتر است

Astra با قیمت ۱۰ دلار برای هر یک میلیون توکن ورودی و ۵۰ دلار برای هر یک میلیون توکن خروجی عرضه شده است. این قیمت تقریباً ۲.۵ برابر نرخ‌های GPT-5.6 Sol است که ۴ دلار برای ورودی و ۲۰ دلار برای خروجی اعلام شده‌اند. OpenAI همچنین برای خواندن داده‌های کش‌شده و نوشتن در کش نرخ‌های جداگانه دارد و حالت سریع Astra با دو برابر قیمت حالت استاندارد ارائه می‌شود.

اما تعداد توکن‌های مصرف‌شده نیز تغییر کرده است. Artificial Analysis می‌گوید Astra در ارزیابی ایجنت کدنویسی در سطح بیشینه حدود یک‌سوم توکن‌های Sol را مصرف کرده است. همین کاهش باعث می‌شود هزینه واقعی هر وظیفه الزاماً به اندازه قیمت اسمی هر توکن افزایش پیدا نکند.

در شاخص هوش، شرایط متفاوت است. Astra حدود ۱۰ درصد توکن خروجی کمتری نسبت به Sol مصرف می‌کند، اما افزایش ۲.۵ برابری قیمت به اندازه‌ای است که هزینه هر وظیفه در سطح بیشینه حدود ۷۵ درصد افزایش پیدا کند.

بنابراین مقایسه قیمت هر توکن به‌تنهایی تصویر کاملی نمی‌دهد. برای مدل‌هایی که وظایف طولانی و ایجنت‌محور انجام می‌دهند، هزینه‌ای که برای تکمیل موفق یک وظیفه پرداخت می‌شود اهمیت بیشتری دارد.

در امنیت سایبری، استرا جهش بزرگ‌تری نشان می‌دهد

یکی از مهم‌ترین تغییرات Astra در ارزیابی‌های امنیت سایبری دیده می‌شود.

مرور بنچمارک‌های GPT-6 Astra؛ آیا مدل جدید OpenAI واقعاً از رقبا بهتر است؟
ExploitBench توانایی مدل در شناسایی و بهره‌برداری از آسیب‌پذیری‌های امنیتی نرم‌افزار را می‌سنجد.

Astra در ExploitBench به امتیاز ۱۰۰ درصد رسیده، درحالی‌که GPT-5.6 Sol امتیاز ۷۸.۵ درصد داشته است. در ExploitGym نیز Astra با ۴۲.۴ درصد بالاتر از Sol با ۳۰.۳ درصد قرار دارد. در ارزیابی جدید ExploitBench که از آسیب‌پذیری‌های سه ماه پیش از زمان آزمون استفاده می‌کند، Astra امتیاز ۳۹ درصد و Sol امتیاز ۵.۵ درصد گرفته‌اند.

مرور بنچمارک‌های GPT-6 Astra؛ آیا مدل جدید OpenAI واقعاً از رقبا بهتر است؟
SRE-Bench: توانایی مدل در حل مسائل مهندسی قابلیت اطمینان سایت، از جمله تحلیل و رفع مشکلات سیستم‌ها، را بررسی می‌کند.

در SRE-Bench نیز Astra در نخستین تلاش ۸۸ درصد وظایف را حل کرده و با چهار تلاش به ۹۹.۲ درصد رسیده است. Sol به‌ترتیب ۵۵.۹ و ۶۸.۷ درصد ثبت کرده است.

OpenAI می‌گوید Astra در جریان ارزیابی حتی دو آسیب‌پذیری روزصفر ناشناخته را کشف و از آن‌ها استفاده کرده و این آسیب‌پذیری‌ها را به توسعه‌دهندگان مربوطه گزارش کرده است. به‌دلیل افزایش قابلیت‌های سایبری، OpenAI Astra را در آستانه «Critical» چارچوب آمادگی سایبری خود قرار داده است.

البته این اعداد محدودیت‌های آزمایشی داشتند. برای نمونه، OpenAI می‌گوید Astra و Sol در ExploitGym بدون محدودیت زمانی شش‌ساعته آزمایش شدند تا توانایی کامل آن‌ها بهتر ارزیابی شود. همچنین در برخی نسخه‌های آزمون، تفاوت در تعداد تلاش‌های مجاز می‌تواند روی نتیجه تأثیر بگذارد.

در ریاضیات، امتیاز بالا به معنای حل همه مسائل نیست

Astra در FrontierMath Tier 4 به امتیاز ۹۷.۶ درصد رسیده است؛ رقمی که بالاتر از Sol با ۸۳ درصد و Fable 5.1 با ۸۷.۸ درصد قرار می‌گیرد.

مرور بنچمارک‌های GPT-6 Astra؛ آیا مدل جدید OpenAI واقعاً از رقبا بهتر است؟
این بنچمارک درباره توانایی مدل در حل مسائل بسیار دشوار ریاضی در سطح پژوهشی است

بااین‌حال، این نتیجه نباید به معنای حل‌شدن مسائل دشوار ریاضی تفسیر شود. کارشناسان به آزمونی سخت‌تر بر پایه ۶۸ مسئله حل‌نشده از مسائل اردوش اشاره می‌کنند که در اجرای رسمی Astra تنها دو مسئله حل شد و با تلاش‌های تکراری این تعداد به پنج مورد رسید؛ اجرای تکراری نیز بیش از ۲۲۰ هزار دلار هزینه محاسباتی داشته است.

آیا Astra بهتر از Fable 5.1 است؟

پاسخ کوتاه این است که نه در همه زمینه‌ها.

Astra در Terminal-Bench 4.0 با ۵۷.۹ درصد بالاتر از Fable 5.1 با ۵۵.۸ درصد قرار دارد. در AutomationBench نیز ۴۱.۴ درصد در برابر ۳۱.۴ درصد برای Astra ثبت شده است. در FrontierMath و GPQA Diamond نیز Astra نتایج بالایی دارد

اما در Humanity’s Last Exam، مدل Fable 5.1 با ۶۵ درصد بالاتر از Astra با ۵۷.۲ درصد است. در شاخص Artificial Analysis Intelligence نیز در نسخه ۴.۱.۱، Fable 5.1 امتیاز ۶۵.۷ و Astra امتیاز ۶۱.۲ گرفته است.

در نتیجه، اگر کار اصلی استفاده از کامپیوتر، اجرای وظایف طولانی، کار با ترمینال یا گردش‌کارهای ایجنت‌محور باشد، Astra یکی از قوی‌ترین گزینه‌ها در میان مدل‌های مقایسه‌شده است. اما در استدلال عمومی و برخی وظایف دانش‌محور، بنچمارک‌ها برتری مطلقی نسبت به Fable 5.1 نشان نمی‌دهند.

نویسنده

این مقاله را دوست داشتید؟

مقالاتی که «نباید» از دست بدهید!

دیدگاه‌ها و پرسش‌و‌پاسخ

دیدگاهتان را بنویسید

نشانی ایمیل شما منتشر نخواهد شد. بخش‌های موردنیاز علامت‌گذاری شده‌اند *