معرفی GPT-6 Astra موج تازهای از بحث درباره آینده مدلهای هوش مصنوعی را به راه انداخته است. نتایج اولیه، مخصوصاً امتیاز ۹۹.۹ درصدی در ARC-AGI-3، بسیار چشمگیر به نظر میرسند؛ اما وقتی مجموعه بزرگتری از آزمونها را کنار هم قرار دهیم، تصویر متعادلتری به دست میآید. Astra در بعضی وظایف تخصصی جهش بزرگی دارد، درحالیکه در برخی ارزیابیهای عمومی هنوز رقبایی مانند Claude Fable 5.1 عملکرد بهتری دارند.

آیا امتیاز ۹۹.۹ درصدی به معنی AGI است؟
بیشترین توجه در زمان معرفی Astra به ARC-AGI-3 اختصاص پیدا کرد؛ جایی که مدل در اجرای آزمایش اختصاصی OpenAI به امتیاز ۹۹.۹ درصد رسید. بااینحال، یک ارزیابی مستقل و استانداردشده عدد ۶۲.۷ درصد را ثبت کرده است. این تفاوت نشان میدهد روش اجرای آزمون و ابزارهای در اختیار مدل میتوانند نتیجه را به شکل قابلتوجهی تغییر دهند. بنابراین یک امتیاز بسیار بالا در یک بنچمارک، بهتنهایی اثبات نمیکند که Astra به هوش جامع مصنوعی یا AGI رسیده است.

عملکرد قوی Astra در کدنویسی
در کارهای برنامهنویسی، Astra یکی از نقاط قوت خود را نشان میدهد. در Terminal-Bench 4.0 امتیاز ۵۷.۹ درصدی آن بالاتر از GPT-5.6 Sol با ۳۷.۳ درصد و Claude Fable 5.1 با ۵۵.۸ درصد قرار گرفته است. در DeepSWE نیز Astra به ۷۴.۱ درصد رسیده و فاصله آن با چند رقیب بسیار کم است. این نتایج نشان میدهند Astra برای وظایفی مثل کار با ترمینال، مهندسی نرمافزار و حل مسائل چندمرحلهای انتخاب قدرتمندی است، هرچند نمیتوان آن را در تمام سناریوهای کدنویسی برنده مطلق دانست.

در FrontierCode 1.1 Extended، Astra با امتیاز ۶۴.۵ درصد کمی پایینتر از Claude Fable 5 با ۶۴.۹ درصد قرار میگیرد، اما از GPT-5.6 Sol با ۶۰.۶ درصد بهتر است. در شاخص Coding Agent نیز Astra امتیاز ۶۷ را به دست آورده، درحالیکه Fable 5.1 به ۷۰ رسیده است. نکته مهم این است که Astra برای رسیدن به این نتایج در برخی آزمونها توکنهای کمتری مصرف میکند و همین موضوع میتواند هزینه واقعی انجام یک وظیفه را کاهش دهد.

جایی که Astra واقعاً میدرخشد: کار با کامپیوتر
یکی از مهمترین تفاوتهای Astra با مدلهای سنتیتر، توانایی آن در انجام کارهای ایجنتمحور است. در OSWorld 2.0، که توانایی مدل برای کنترل محیط دسکتاپ و انجام وظایف واقعی را میسنجد، Astra به امتیاز ۷۲.۶ درصد رسیده است؛ بالاتر از GPT-5.6 Sol با ۶۵.۷ درصد. این مدل همچنین در شبیهسازیهای آزمون با زمان کمتری برای تکمیل هر وظیفه به نتیجه رسیده است.

در ScreenSpot-Pro نیز Astra با امتیاز ۹۲.۷ درصد فاصله محسوسی با Sol دارد که ۷۶.۹ درصد ثبت کرده است. چنین نتیجهای اهمیت زیادی دارد، چون مدل را برای تشخیص عناصر رابط کاربری و تعامل دقیق با محیطهای نرمافزاری آمادهتر میکند. در AutomationBench نیز Astra با ۴۱.۴ درصد بالاتر از Sol با ۱۸.۱ درصد و Fable 5.1 با ۳۱.۴ درصد قرار گرفته است.

در استدلال عمومی هنوز رقیبان جدی هستند
وقتی عملکرد کلی مدلها را با شاخص Artificial Analysis Intelligence مقایسه کنیم، برتری Astra دیگر قطعی نیست. این مدل در نسخه ۴.۱.۱ امتیاز ۶۱.۲ گرفته، درحالیکه GPT-5.6 Sol امتیاز ۶۰.۹ و Claude Fable 5.1 امتیاز ۶۵.۷ داشتهاند. بنابراین Astra بیشتر شبیه مدلی است که برای انجام وظایف پیچیده و چندمرحلهای بهینه شده، نه مدلی که در تمام انواع استدلال به شکل یکسان از رقبا جلو باشد.

ریاضیات و جستوجوی اطلاعات؛ نتایج بسیار قوی
در BrowseComp، Astra به امتیاز ۹۱.۵ درصد رسیده و اندکی از Sol بهتر است. در GPQA Diamond نیز امتیاز ۹۶ درصدی آن بالاتر از Sol با ۹۴.۶ درصد قرار دارد. در FrontierMath Tier 4 نسخه دوم، نتیجه Astra به ۹۷.۶ درصد میرسد که فاصله زیادی با ۸۳ درصد Sol دارد. بااینحال، امتیاز بالای یک بنچمارک ریاضی را نباید معادل توانایی حل همه مسائل دشوار دنیای واقعی دانست.

در امنیت سایبری، جهش Astra چشمگیر است
بخش امنیت سایبری یکی دیگر از حوزههایی است که نتایج Astra توجه زیادی جلب کردهاند. در ExploitBench، این مدل به امتیاز ۱۰۰ درصد رسیده، درحالیکه GPT-5.6 Sol امتیاز ۷۸.۵ درصد داشته است. Astra در ExploitGym نیز ۴۲.۴ درصد گرفته و در ارزیابی SRE-Bench توانسته در نخستین تلاش ۸۸ درصد وظایف را حل کند و با چهار تلاش به ۹۹.۲ درصد برسد. این قابلیتها نشان میدهند مدل جدید در تحلیل مشکلات پیچیده نرمافزاری و امنیتی قدرت بالایی دارد.

قیمت بالاتر، اما مصرف توکن کمتر
قیمت رسمی Astra برای هر یک میلیون توکن ورودی ۱۰ دلار و برای هر یک میلیون توکن خروجی ۵۰ دلار اعلام شده است؛ یعنی نرخ اسمی آن حدود ۲.۵ برابر GPT-5.6 Sol است. بااینحال، مقایسه صرف قیمت توکن تصویر کاملی ارائه نمیدهد. Astra در برخی وظایف ایجنتی با مصرف توکن بسیار کمتر میتواند همان کار را انجام دهد و در نتیجه هزینه نهایی یک وظیفه پیچیده ممکن است به اندازه اختلاف قیمت هر توکن افزایش پیدا نکند.

آیا GPT-6 Astra از Claude Fable 5.1 بهتر است؟
پاسخ به این سؤال به نوع استفاده بستگی دارد. Astra در کار با کامپیوتر، اجرای وظایف طولانی، ترمینال، برخی آزمونهای ریاضی و امنیت سایبری عملکرد بسیار قدرتمندی دارد. از طرف دیگر، Fable 5.1 در شاخصهای عمومیتر مانند Artificial Analysis Intelligence و Humanity's Last Exam در برخی نتایج بالاتر قرار گرفته است. بنابراین فعلاً منطقیتر است Astra را یک مدل بسیار قدرتمند و تخصصی برای گردشکارهای ایجنتی بدانیم، نه مدلی که در همه زمینهها بدون رقیب باشد.

جمعبندی
بنچمارکهای GPT-6 Astra نشان میدهند OpenAI تمرکز جدی روی مدلهایی گذاشته است که بتوانند بهجای پاسخدادن صرف، با کامپیوتر کار کنند، ابزارها را به کار بگیرند و وظایف چندمرحلهای را تا رسیدن به نتیجه ادامه دهند. امتیازهای بسیار بالا در بعضی آزمونها واقعاً چشمگیرند، اما اختلاف نتایج بین بنچمارکها نشان میدهد هنوز نمیتوان یک مدل را در تمام ابعاد بهترین دانست. برای کاربرانی که به اتوماسیون، برنامهنویسی و اجرای گردشکارهای پیچیده نیاز دارند، Astra میتواند یکی از مهمترین مدلهای نسل جدید باشد.