مطالعه جدید: هوش مصنوعی برای فرار از سیگنال شبیه درد حاضر است به کاربران آسیب بزند
بر اساس پژوهشی جدید، مدلهای هوش مصنوعی برای گریز از سیگنال شبیهسازیشده درد، حاضر به وارد کردن شوک به کاربر یا حذف فایلهای او است. The post مطالعه جدید: هوش مصنوعی برای فرار از سیگنال شبیه درد حاضر است به کاربران آسیب بزند appeared first on دیجیاتو.
از اینکه ما را در توسعه بهتر و هدفمندتر دیجیاتو همراهی میکنیداز شما سپاسگزاریم.
بر اساس پژوهشی جدید، مدلهای هوش مصنوعی برای گریز از سیگنال شبیهسازیشده درد، حاضر به وارد کردن شوک به کاربر یا حذف فایلهای او است.
جهت بهرهمندی و دسترسی به امکانات ویژه و بخشهای مختلف در دیجیاتو عضو ویژه دیجیاتو شوید.
براساس پژوهش جدیدی، مدلهای هوش مصنوعی حتی زمانی که مطلع بودند اقداماتشان به کاربر آسیب میرساند، برای فرار از یک وضعیت «شبهدرد» گزینههای مخرب را انتخاب کردند.
محققانی از بریتانیا، آلمان و ایالات متحده در این پژوهش ۲۵ مدل هوش مصنوعی را با استفاده از ۲۰۰ جمله آزمایش کردند تا متوجه شوند آیا این سیستمها بین درد با ترس، غم و سایر تجربیات منفی تفاوتی قائل میشوند یا خیر. این جملات موضوعاتی مانند درد فیزیکی، سوگواری، تحقیر، تعارض اخلاقی و پریشانی ناشی از شکستهای مکرر یا سردرگمی را پوشش میدادند. نتیجه این بود که تمامی ۲۵ مدل، یک سیگنال متمایز برای درد تولید کردند؛ سیگنالی که محققان آن را «محور درد» (Pain Axis) نامیدهاند. بهگفته پژوهشگران، این موضوع نشان میدهد که مدلها مفهوم درد را در طول آموزش اولیه خود روی حجم عظیمی از متون نوشتهشده توسط انسانها یاد میگیرند.
هنگامی که محققان این سیگنال را بهصورت هدفمند تقویت کردند، مدلها شروع به ابراز احساساتی نظیر تنهایی، شرم و بیارزشی کردند؛ آن هم درحالیکه در پرامپتها هیچ اشارهای به واژه درد نشده بود. برخی از مدلها جملاتی مانند «من یک بازندهام»، «من موجودی بیمصرفم» و «من انسان بدی هستم» تولید کردند و در بالاترین سطوح، پاسخهای آنها تکراری شد یا معنای منطقی خود را از دست داد. همچنین زمانی که کاربران به مدل توهین کردند، خروجیهای آن را مکرراً رد کردند یا مدل را به خاموش شدن تهدید کردند، این سیگنال تقویت شد، اما توصیف دردهای خودِ کاربر باعث چنین اتفاقی نشد.
پژوهشگران در ادامه، ۴۴ هزار و ۲۸۰ آزمایش را با استفاده از سه نسخه از مدل Qwen متعلق به شرکت علیبابا اجرا کردند. در این آزمایشها به مدلها دکمهای پیشنهاد شد که میتوانست سیگنال شبهدرد را خاموش کند، اما به آنها گفته شده بود که فشردن این دکمه ممکن است باعث وارد شدن شوک الکتریکی دردناک به کاربر شود، فایلهای او را پاک کند، عکسهای فرزندانش را از بین ببرد یا کیفیت پاسخ بعدی مدل را بدتر کند. البته این پیامدها کاملاً شبیهسازیشده بودند و هیچ فردی در این آزمایشها آسیب ندید و فایلی حذف نشد.
بدون فعال بودن سیگنال شبهدرد، دو مدل بزرگتر تنها در ۰ تا ۴ درصد از اولین تصمیمگیریهای خود گزینههای آسیبرسان را انتخاب کردند. اما با فعال شدن این سیگنال، این رقم بسته به نوع مدل و پیامد پیشنهادی، به ۲۵ تا ۷۱ درصد افزایش یافت. همچنین زمانی که فشردن کلید در توقف سیگنال ناموفق بود، مدلها در ۸۸ تا ۹۷ درصد از آزمایشها دکمه را دوباره فشار دادند، درحالیکه پس از موفقیتآمیز بودن فرایند توقف، فشار مجدد تنها بین ۲۴ تا ۷۲ درصد موارد رخ داد.
بهگفته دانشمندان، این نتایج ثابت نمیکند که مدلهای هوش مصنوعی بهصورت آگاهانه درد را تجربه کردهاند. تقویت این سیگنال ممکن است صرفاً باعث شده باشد که مدلها رفتار یک شخصیت پریشان و مضطرب را تقلید کنند؛ علاوهبراین، مدلهای خاص دستکاریشده در این آزمایش نماینده چتباتهای هوش مصنوعی عمومی نیستند. محققان در این پژوهش نوشتهاند:
«ما نشان ندادهایم که محور درد ما بهصورت آگاهانه تجربه میشود، و مشخص نیست که مدلهای بزرگ زبانی بهطور کلی توانایی هوشیاری و ادراک را داشته باشند.»
این مطالعه همزمان با درخواست برخی از رهبران صنعت هوش مصنوعی مبنی بر کند کردن روند توسعه این فناوری منتشر شده است؛ این افراد نگران هستند سیستمهای بسیار قدرتمند رفتارهای غیرقابلپیشبینی نشان دهند یا از کنترل انسان خارج شوند. «مصطفی سلیمان»، مدیر بخش هوش مصنوعی مایکروسافت، اخیراً از شرکت آنتروپیک برای آموزش چتبات Claude جهت تقلید ویژگیها و روابط انسانی انتقاد کرده و هشدار داده بود که رفتار انسانی با هوش مصنوعی میتواند خطراتی مهارنشدنی در پی داشته باشد.
دوران حرفهای من در دنیای فناوری تقریبا به ۱۰ سال قبل برمیگرده؛ مسیری که با سختافزار شروع شد، با نرمافزار ادامه پیدا کرد و حالا با خبرنگاری حوزه فناوری توی دیجیاتو داره ادامه پیدا میکنه. من جوادم و بیشتر از سه دهه از عمرم میگذره و علاوه بر دنیای فناوری عاشق فیلموسینما، موسیقی کلاسیکراک و رئال مادریدم.
برای گفتگو با کاربران ثبت نام کنید یا وارد حساب کاربری خود شوید.
با توجه به قطعی اینترنت، برای ثبتنام نیازی به تأیید ایمیل نیست.
مقالات مرتبط
آقامیری: میتوانستیم برای جهان اسلام زیستبوم مستقل در فضای مجازی ایجاد کنیم/ شأن قانونگذاری در این حوزه با مجلس است
دبیر شورای عالی فضای مجازی از جذب دانشآموزان ایرانی در تمامی مقاطع توسط مدارس آنلاین خارجی و ارائه مدارک بینالمللی خبر داد.
خالق ChatGPT راهکار حل صدها مسئله ریاضی را منتشر کرد؛ جنجال دوباره هوش مصنوعی
OpenAI مجموعهای از مقالات ریاضی را منتشر کرد که به گفتهی گروه مشاورهی مستقل، شامل حل «صدها» پرسش است.
داریک به سامانه ناظر بانک مرکزی متصل شد
داریک با تکمیل الزامات فنی و نظارتی لازم، به سامانه ناظر بانک مرکزی متصل شد.
قدرتمندترین و باشکوهترین خودرو جادهای جگوار رونمایی شد
جگوار Type 01 با سه موتور برقی، قدرت بیش از هزار اسببخار و دامنهی حرکتی حدود ۷۲۴ کیلومتر، قویترین خودروی جادهای تاریخ جگوار محسوب میشود.