آیا با مدل GPT-6 Astra واقعاً به عصر هوش جامع مصنوعی وارد شدیم؟
اوپنایآی مدعی است GPT-6 Astra بشر را به آستانه هوش جامع مصنوعی رسانده، اما نتایج آزمونهای مستقل پرسشهایی درباره این ادعا ایجاد کردهاند. The post آیا با مدل GPT-6 Astra واقعاً به عصر هوش جامع مصنوعی وارد شدیم؟ appeared first on دیجیاتو.
از اینکه ما را در توسعه بهتر و هدفمندتر دیجیاتو همراهی میکنیداز شما سپاسگزاریم.
اوپنایآی مدعی است GPT-6 Astra بشر را به آستانه هوش جامع مصنوعی رسانده، اما نتایج آزمونهای مستقل پرسشهایی درباره این ادعا ایجاد کردهاند.
جهت بهرهمندی و دسترسی به امکانات ویژه و بخشهای مختلف در دیجیاتو عضو ویژه دیجیاتو شوید.
اوپنایآی مدعی است مدل GPT-6 Astra بشر را به آستانه هوش جامع مصنوعی (AGI) رسانده است؛ بااینحال، اختلاف در نتایج آزمونها، استفاده از روشهای اختصاصی برای ارزیابی مدل و عملکرد نهچندان بهتر آن در برخی سنجشهای مستقل، تردیدهایی درباره میزان پیشرفت واقعی این مدل ایجاد کرده است. درحالیکه این مدل در برخی آزمونها امتیازهای بیسابقهای به دست آورده، پژوهشگران میگویند موفقیت در بنچمارکها لزوماً به معنای دستیابی به هوشی همسطح انسان نیست. در ادامه این موضوع را بیشتر تشریح میکنیم.
به اعتقاد اوپنایآی، عرضه GPT-6 Astra میتواند نقطه عطفی در مسیر توسعه هوش مصنوعی باشد. این ادعا در شرایطی مطرح میشود که نگرانیها درباره ایمنی مدلهای پیشرفته افزایش یافته است. برخی پژوهشگران مستقل و طراحان بنچمارکها نیز میگویند امتیازهای بالای Astra تا حد زیادی به بهینهسازیهای ویژه برای آزمونها وابسته است و لزوماً نشاندهنده توانایی آن در تعمیم آموختهها به موقعیتهای جدید نیست.
«گراگ براکمن»، رئیس اوپنایآی، هنگام معرفی این مدل در نشست خبری سوم سپتامبر گفت:
«اگر چند سال به جلو برویم و به گذشته نگاه کنیم و بپرسیم واقعاً چه زمانی هوش جامع مصنوعی ایجاد شد، فکر میکنم این زمان باشد و احتمال میدهم این مدل همان نقطه عطف باشد.»
اما آیا نتایج آزمایشها چنین ادعایی را تأیید میکنند؟ بررسی عملکرد GPT-6 Astra نشان میدهد که برای پاسخ به این پرسش، باید علاوهبر امتیازهای چشمگیر آن، روش ارزیابی، هزینه دستیابی به این نتایج و عملکرد مدل در کاربردهای عملی را نیز در نظر گرفت.
اوپنایآی هنگام معرفی GPT-6 Astra، نتایج آن را در مجموعهای از بنچمارکها منتشر کرد که توانایی مدلهای هوش مصنوعی را در انجام وظایف مختلف میسنجند. این شرکت اعلام کرد که مدل جدید در حوزههایی مانند مهندسی نرمافزار، استفاده مستقل از برنامههای کامپیوتری، حل مسائل ریاضی و پژوهش علمی، عملکردی در سطح پیشرفتهترین مدلهای موجود دارد.
در نمایشهای معرفی Astra، این مدل توانست کدهای طراحی سهبعدی به کمک کامپیوتر (CAD) تولید کند، چیدمان بردهای مدار چاپی را در نرمافزارهای طراحی انجام دهد، مدلهای دیجیتال سهبعدی را به محیطهای تعاملی شبیه بازیهای ویدیویی تبدیل کند و با دریافت دستور متنی، برنامههای وب را روی زیرساختهای میزبانیشده مستقر کند.
رئیس پژوهشهای کاربردی شرکت هاروی (Harvey)، توسعهدهنده ابزارهای هوش مصنوعی برای خدمات حقوقی، نیز در اطلاعیه اوپنایآی به توانایی استرا در انجام کارهای حقوقی اشاره کرد. او گفت: «در آزمایشهای اولیه ما، Astra در مواجهه با کارهای حقوقی رویکردی شبیه وکیلی نکتهسنج داشت.»
یکی از مهمترین نتایج منتشرشده به آزمون ARC-AGI-3 مربوط میشود. این بنچمارک برای سنجش میزان کارآمدی هوش مصنوعی در یادگیری مهارتهای جدید در محیطهای انتزاعی و ناآشنا طراحی شده است.
Astra در این آزمون به امتیاز ۹۹٫۹ درصد رسید. آزمایش مستقل بنیاد غیرانتفاعی ARC Prize، نهاد ناظر بر این بنچمارک، نیز نشان داد که این مدل در ۹۶ درصد مراحل آزمون از معیارهای پایه مربوط به کارآمدی تعداد اقدامات انسانها فراتر رفته است. Astra بهطور میانگین برای تکمیل هر مرحله، به ۵۱٫۷ درصد اقدام کمتر از حلکنندگان انسانی نیاز داشت.
رئیس بنیاد ARC Prize در اطلاعیه اوپنایآی گفت: «این نهتنها بهترین مدلی است که تاکنون آزمایش کردهایم، بلکه نشاندهنده جهشی معنادار در عملکرد مدلهای پیشرفته است.» بااینحال، خود بنیاد ARC Prize تأکید کرده است که رسیدن به امتیاز کامل یا نزدیک به کامل در این آزمون، بهتنهایی اثبات نمیکند که مدلی به هوش جامع مصنوعی دست یافته است.
بخشی از انتقادها به عملکرد Astra در ARC-AGI-3 به شیوه اجرای آزمون مربوط میشود. براساس گزارشها، بالاترین امتیاز این مدل با استفاده از روشی اختصاصی به نام Provider Adapter به دست آمده است؛ لایهای نرمافزاری که چارچوب ارزیابی را برای اجرای مدل آماده میکند و در دسترس توسعهدهندگان رقیب قرار ندارد.
هنگامی که Astra با چارچوب استاندارد و بیطرف این بنچمارک آزمایش شد، امتیاز آن به ۶۲٫۷ درصد کاهش یافت. این اختلاف نشان میدهد که انتخاب روش ارزیابی میتواند تأثیر قابلتوجهی بر نتیجه نهایی داشته باشد.
بنیاد ARC Prize همچنین توضیح داده است که محیطهای معمایی بسته و قطعی این آزمون، پیچیدگی بیپایان دنیای واقعی را بازنمایی نمیکنند. بنابراین، حتی اگر مدلی بتواند تمام مراحل بنچمارک را با موفقیت پشت سر بگذارد، این نتیجه بهتنهایی برای اثبات توانایی آن در تعمیم گسترده آموختهها کافی نیست.
«هنگام راهاندازی ARC-AGI-3، تصریح کردیم که رسیدن به سقف امتیاز این بنچمارک به معنای اثبات دستیابی به AGI نیست. بنابراین، با اینکه معتقدیم Astra پیشرفت معناداری در جهت تعمیمپذیری نشان میدهد، ادعا نمیکنیم که این مدل به AGI رسیده است.»
تفاوت میان امتیازهای گزارششده از همان ابتدا نیز مورد توجه قرار گرفت. به گزارش فورچون، در نسخهای از اطلاعات مربوط به Astra که پیش از عرضه رسمی و تحت توافق محرمانگی در اختیار رسانهها قرار گرفته بود، امتیاز این مدل در ARC-AGI-3 برابر با ۹۸٫۶ درصد اعلام شده بود؛ اما این رقم در وبسایت رسمی آزمون به ۹۹٫۹ درصد افزایش یافت.
«آنکا رویل» و «مایک هاردی»، پژوهشگران دکتری هوش مصنوعی در دانشگاه استنفورد، نیز به تغییرات بیسروصدای برخی معیارهای منتشرشده از سوی اوپنایآی پس از عرضه مدل اعتراض کردند. به گفته آنها، شرکت در مقطعی نرخ توهم مدل را از ۴٫۲ درصد به ۲ درصد کاهش داد، اما بعداً دوباره آن را به رقم قبلی بازگرداند.
رویل و هاردی در گفتوگو با فورچون، تغییرات مکرر اعداد را به پدیدهای به نام «بنچمارکمکسینگ» (Benchmaxxing) نسبت دادند. این اصطلاح به روشی اشاره دارد که در آن توسعهدهندگان بارها آزمونها را با تغییرات جزئی در دستورهای متنی، چارچوبهای نرمافزاری یا میزان محاسبات تکرار میکنند تا بالاترین امتیاز نظری ممکن را به دست آورند.
چنین رویکردی میتواند باعث شود نتایج منتشرشده بیش از آنکه بازتابدهنده عملکرد معمول مدل باشند، توانایی آن را در شرایط آزمایشگاهی بهینهشده نشان دهند.
در مقالهای با عنوان «بنچمارکگیری خراب است؛ اجازه ندهید هوش مصنوعی داور خودش باشد» که در سال ۲۰۲۵ منتشر شد، گروهی از پژوهشگران درباره پیامدهای این شیوه هشدار دادند. آنها استدلال کردند که چنین روشهایی سردرگمی ایجاد میکنند و اعتماد به نتایج ارزیابی را کاهش میدهند. این مشکل بهویژه زمانی جدی میشود که مستندات فنی رسمی، اطلاعات پایه درباره روش آزمایش را منتشر نکنند و راستیآزمایی مستقل نتایج را تقریباً ناممکن کننند.
از این منظر، امتیازهای حاصل از بنچمارکمکسینگ ممکن است سقف عملکرد نظری مدل را در شرایط آزمایشگاهی بهینه نشان دهند، نه میزان اتکاپذیری آن را در استفاده روزمره و بدون تنظیمات ویژه.
در نتیجه، برای ارزیابی ادعای دستیابی به هوش جامع مصنوعی، صرفاً نگاهکردن به بالاترین امتیازهای منتشرشده کافی نیست. باید مشخص باشد مدل در چه شرایطی آزمایش شده، چه میزان تنظیمات اختصاصی دریافت کرده و آیا میتواند همان عملکرد را در موقعیتهای متفاوت نیز حفظ کند.
یافتههای شرکت مستقل ارزیابی هوش مصنوعی Artificial Analysis با بخشی از نتایج منتشرشده از سوی اوپنایآی همخوانی ندارد.
در شاخص هوش Artificial Analysis که معیاری ترکیبی برای ارزیابی توانایی استدلال عمومی مدلهای پیشرفته محسوب میشود، امتیاز GPT-6 Astra برابر با ۶۱ باقی ماند؛ دقیقاً همان امتیازی که GPT-5.6 Sol کسب کرده بود. استرا همچنین در این ارزیابی از مدلهایی مانند Claude Fable 5.1 متعلق به آنتروپیک و Muse Spark 1.3 متعلق به متا عقبتر بود.
بنابراین، دستکم بر اساس این شاخص مستقل، عرضه Astra به افزایش امتیاز هوش عمومی آن نسبت به نسل قبلی منجر نشده است؛ هرچند این نتیجه بهتنهایی به معنای نبود پیشرفت در تمام قابلیتهای مدل نیست.
در برخی بنچمارکها، Astra نسبت به نسل قبل پیشرفت کرده، اما در آزمونهای دیگر عملکرد ضعیفتری نشان داده است. یکی از این موارد GDPval-AA است که وظایف واقعی محیط کار را در ۴۴ حوزه شغلی ارزیابی میکند و بر کاربردهای اقتصادی تواناییهای هوش مصنوعی تمرکز دارد.
براساس آزمایشهای Artificial Analysis، جایگاه نسبی Astra در رتبهبندی این آزمون در مقایسه با GPT-5.6 Sol بهطور قابلتوجهی افت کرده است. افت عملکرد در برخی آزمونهای دیگر نیز مشاهده شد؛ از جمله ارزیابیهای مربوط به پشتیبانی مشتریان، برنامهنویسی علمی با پایتون و استدلال درباره اسناد طولانی و مجموعههای بزرگی از اطلاعات.
این تفاوتها نشان میدهند که پیشرفت در یک دسته از وظایف الزاماً به معنای بهبود عملکرد در همه زمینهها نیست. مدل ممکن است در برخی کارهای تخصصی بهتر عمل کند، اما در وظایف دیگری که برای استفاده حرفهای اهمیت دارند، نسبت به نسل قبلی پیشرفت نکند یا حتی ضعیفتر شود.
«دیوید وود»، رئیس سازمان غیرانتفاعی London Futurists که نشستهایی درباره فناوریهای نوظهور برگزار میکند، معتقد است اهمیت Astra را نباید فقط با امتیازهای آن در آزمونها سنجید. از نظر او، این مدل نشاندهنده تغییری اساسی در نحوه تعامل انسانها با هوش مصنوعی است؛ تغییری که در آن سیستمها از پاسخ دادن به پرسشها فراتر میروند و میتوانند در محیطهای دیجیتال، اهداف پیچیده را بهصورت مستقل دنبال کنند.
وود میگوید: «نتایج چشمگیر بنچمارکها اهمیت دارند، اما آنچه اهمیت بیشتری دارد، ترکیب هوش، خودمختاری، توانایی استفاده از کامپیوتر و قابلیتهای امنیت سایبری است.» او در ادامه هشدار میدهد: «این ترکیب به احتیاط نیز نیاز دارد. هرچه این سیستمها مفیدتر شوند، پیامدهای ناشی از درک نادرست خواستههای ما، استفاده نادرست از آنها یا یافتن راههایی برای دور زدن سازوکارهای حفاظتی که برایشان در نظر گرفتهایم، جدیتر خواهد شد.»
به اعتقاد وود، بحث درباره اینکه آیا Astra را میتوان نمونهای از هوش جامع مصنوعی دانست، در مقایسه با مسئله کنترل و حکمرانی هوش مصنوعی اهمیت کمتری دارد. از نظر او، سازوکارهای نظارتی و کنترلی باید همپای پیشرفت فنی توسعه پیدا کنند.
مجموع نتایج منتشرشده از GPT-6 Astra تصویری چندوجهی از این مدل ارائه میکند: عملکرد بسیار بالا در برخی بنچمارکها، کاهش مصرف توکن در تعدادی از وظایف، بهبود برخی سازوکارهای ایمنی و در مقابل، نبود پیشرفت در یک شاخص مستقل هوش عمومی، افت عملکرد در بعضی آزمونهای کاربردی و اختلاف قابلتوجه میان نتایج بهدستآمده با روشهای ارزیابی متفاوت.
این دادهها بهتنهایی ادعای دستیابی به AGI را اثبات نمیکنند و نشان میدهند که برای ارزیابی تواناییهای واقعی مدل، باید فراتر از اعداد تبلیغشده به روش آزمونها و عملکرد آن در شرایط متنوع توجه کرد.
دانشآموخته زبانشناسی هستم و همانقدر که به «کلمه» علاقهمندم، از سرککشیدن به گوشهوکنارِ جهان تکنولوژی و علم هم حظ میکنم.
برای گفتگو با کاربران ثبت نام کنید یا وارد حساب کاربری خود شوید.
با توجه به قطعی اینترنت، برای ثبتنام نیازی به تأیید ایمیل نیست.
مقالات مرتبط
محصولی که برق یخچال، قهوهساز و لامپهای خانه را تا دو روز تأمین میکند
انکر از پاور استیشن غولپیکر SOLIX S5000 با ظرفیت ۵٬۰۲۴ واتساعت و سرعت شارژ ۹۹ دقیقهای رونمایی کرد.
مرگ خورشید فقط سیارههای درونی را نابود نمیکند؛ کل منظومه شمسی فرو میپاشد
برخلاف تصور رایج، محدوده بیرونی منظومه شمسی از تبعات مرگ خورشید در امان نخواهد بود و مثل بخش درونی، دچار آشوب و ویرانی خواهد شد.
ساعت جدید تایمکس با موتور سیکو و حالت دوزمانه معرفی شد
تایمکس از ساعت مکانیکی جدید Pan Am Waterbury GMT با موتور خودکار ژاپنی و قابلیت نمایش دو منطقهی زمانی رونمایی کرد.
دفن زبالههای هستهای با فناوری حفاری نفت؛ ایدهای متفاوت برای حل معضلی قدیمی
فناوری باسابقهای که سالها برای رسیدن به مخازن نفت و گاز استفاده میشد، حالا قرار است برای یکی از مشکلات صنعت هستهای آزمایش شود.