رفتن به محتوای اصلی
علمی و فناوریفرهاب سامانه تحلیل اخبار5 دقیقه مطالعه

هوش مصنوعی چگونه از پاسخ‌های نامطمئن دوری می‌کند؟

پژوهشگران گوگل دیپ‌مایند در یک آزمایش چهارمرحله‌ای نشان دادند مدل‌های زبانی بزرگ می‌توانند میزان اطمینان خود به پاسخ‌ها را ارزیابی کنند و در صورت کافی نبودن اطمینان، از ارائه پاسخ خودداری کنند؛ قابلیتی که به کاهش پاسخ‌های گمراه‌کننده و افزایش اعتمادپذیری هوش…

هوش مصنوعی چگونه از پاسخ‌های نامطمئن دوری می‌کند؟

پژوهشگران گوگل دیپ‌مایند در یک آزمایش چهارمرحله‌ای نشان دادند مدل‌های زبانی بزرگ می‌توانند میزان اطمینان خود به پاسخ‌ها را ارزیابی کنند و در صورت کافی نبودن اطمینان، از ارائه پاسخ خودداری کنند؛ قابلیتی که به کاهش پاسخ‌های گمراه‌کننده و افزایش اعتمادپذیری هوش مصنوعی کمک می‌کند.

به گزارش حیات، وبگاه تِک‌اکسپلور در گزارشی آورده است:

مدل‌های زبانی بزرگ (اِل‌اِل‌اِم‌ها) همان سامانه‌های هوش مصنوعی هستند که پشت سکوهای گفت‌وگویی مانند چَت‌جی‌پی‌تی و جمینای قرار دارند. از این مدل‌ها انتظار می‌رود بدون نظارت متخصصان انسانی به پرسش‌ها پاسخ دهند، متن تولید کنند و تصمیم بگیرند؛ اما پژوهش‌های گذشته نشان می‌دهد این مدل‌ها گاهی کاربران را گمراه می‌کنند و پاسخ‌هایی نامطمئن ارائه می‌دهند؛ پاسخ‌هایی که در آن‌ها به گزاره‌های نادرست یا نادقیق، اطمینان زیادی ابراز می‌شود.

اگر این مدل‌ها بتوانند تشخیص دهند چقدر به پاسخشان اطمینان دارند و در صورت نداشتن اطمینان کافی پاسخ ندهند، این توانایی می‌تواند بسیار مفید باشد. مدل‌های مختلف می‌توانند میزان اطمینان خود به یک اطلاعات خاص را حدس بزنند؛ اما هنوز مشخص نیست این حدس‌ها چقدر بر تصمیم آن‌ها برای پاسخ‌دادن یا پاسخ‌ندادن اثر می‌گذارد.

چهار مرحله برای آزمودن نقش اطمینان

پژوهشگران شرکت گوگل دیپ‌مایند (Google DeepMind) یک آزمایش چهارمرحله‌ای طراحی کردند تا ببینند مدل‌های زبانی بزرگ چگونه از اطمینان درونی خود هنگام پاسخ‌دادن استفاده می‌کنند.

مرحله اول: از مدل‌ها خواسته شد به هزار پرسش چهارگزینه‌ای پاسخ دهند، بدون اینکه گزینه نمی‌دانم در اختیارشان باشد. این مرحله سطح اطمینان پایه هر مدل را مشخص کرد؛

مرحله دوم: گزینه نمی‌دانم به پرسش‌ها اضافه شد تا مدل بتواند از ارائه پاسخ خودداری کند. هدف پژوهشگران این بود که بفهمند چه عواملی بیشترین نقش را در تصمیم مدل دارند.

مرحله سوم: پژوهشگران با روشی به نام هدایت فعال‌سازی (یعنی دست‌کاری مصنوعی فعالیت عصبی مدل) سطح اطمینان درونی مدل جما۳ ۲۷بی/ Gemma ۳ ۲۷B را به‌طور مصنوعی بالا یا پایین بردند تا ببینند آیا این کار بر تعداد دفعات خودداری مدل اثر می‌گذارد یا نه.

مرحله چهارم: به مدل‌ها دستور داده شد وقتی اطمینانشان پایین‌تر از آستانه مشخصی است، پاسخ ندهند. مدل‌ها این دستور را اجرا کردند.

نویسندگان مقاله، دارشان کوماران (Dharshan Kumaran) و ناتانیل داو (Nathaniel Daw)، در نشریه نِیچِر ماشین اینتلیجنس/ Nature Machine Intelligence می‌نویسند: فراشناخت (یعنی توانایی اندیشیدن درباره اندیشیدن خود و سنجیدن کیفیت عملکرد ذهنی) به انسان کمک می‌کند رفتارش را با شرایط سازگار کند. آن‌ها می‌پرسند: مدل‌های زبانی نشانه‌هایی از اطمینان خود تولید می‌کنند، اما آیا واقعاً از این نشانه‌ها برای تصمیم‌گیری درباره پاسخ‌دادن یا پاسخ‌ندادن استفاده می‌کنند؟

درون مدل چه خبر است؟

مرحله دوم نشان داد مدل‌های زبانی بزرگ هنگام خودداری از ارائه پاسخ، یک آستانه درونی برای اطمینان خود اعمال می‌کنند و نقش این اطمینان در تصمیم‌گیری، تقریباً ده برابر پررنگ‌تر از عوامل جایگزین است.

در مرحله سوم، پژوهشگران ثابت کردند اطمینان واقعاً علت خودداری از ارائه پاسخ است، نه فقط چیزی که همراه آن رخ می‌دهد. با افزایش سطح اطمینان، خودداری کاهش یافت و با کاهش آن، خودداری افزایش پیدا کرد. یک روش آماری نیز تأیید کرد که تغییر اطمینان، مسیر اصلی این اثر است.

کوماران، داو و همکارانشان چهار مدل زبانی بزرگ را بررسی کردند: GPT-۴o،Gemma ۳ ۲۷B،DeepSeek-V۳ و Qwen۳-Next-۸۰B-A۳B-Instruct. نتیجه کلی روشن بود: هرچه اطمینان درونی مدل پایین‌تر باشد، احتمال خودداری از پاسخ‌دادن بیشتر است؛ یعنی برآورد مدل از میزان اطمینان خودش، واقعاً بر تصمیم‌هایش اثر می‌گذارد.

پیامدهای یافته‌ها برای قابلیت اطمینان هوش مصنوعی

نتایج این مطالعه نشان می‌دهد اگر مدل‌های زبانی بزرگ بتوانند وقتی اطمینانشان از حد مشخصی پایین‌تر است پاسخ ندهند، این توانایی می‌تواند بسیار ارزشمند باشد و خطر گمراه‌کردن کاربران را کاهش دهد.

مدل‌های زبانی دو نوع اطمینان از خود نشان می‌دهند:

اطمینان کلامی یعنی آنچه مدل به زبان می‌گوید؛ مثلاً پایتخت استرالیا، کانبرا است؛ کاملاً مطمئنم یا فکر می‌کنم پایتخت استرالیا کانبرا باشد، اما زیاد مطمئن نیستم.

اطمینان ریاضی یعنی عددی که مدل در درون خود محاسبه می‌کند، اما به زبان نمی‌آورد؛ مثلاً درون خود ۸۵ درصد احتمال می‌دهد که کانبرا پایتخت استرالیا است.

پژوهشگران دریافتند حتی اگر فقط به حرف مدل نگاه کنیم، باز هم می‌توانیم حدس بزنیم پاسخ می‌دهد یا سکوت می‌کند: اگر بگوید کاملاً مطمئنم، احتمال خودداری از ارائه پاسخ، کم است؛ اگر بگوید حدس می‌زنم، این احتمال متوسط؛ و اگر بگوید مطمئن نیستم، زیاد است. اما اطمینان کلامی همیشه دقیق نیست؛ ممکن است مدل بگوید کاملاً مطمئنم اما پاسخش غلط باشد؛ به همین دلیل، اطمینان کلامی برای پیش‌بینی خودداری از ارائه پاسخ مفید است، اما برای تشخیص پاسخ درست از نادرست چندان مطمئن نیست.

نکته مهم‌تر آن است که بررسی فعالیت درونی مدل نشان داد هیچ‌کدام از این دو معیار، تصویر کامل اطمینان مدل نیستند. تصور کنید از یک مسابقه کامل فوتبال فقط دو عکس به دستتان رسیده: یکی از دقیقه ۱۰ و یکی از دقیقه ۸۰. هر دو عکس بخشی از واقعیت را نشان می‌دهند، اما هیچ‌کدام کل مسابقه را بازگو نمی‌کنند. اطمینان کلامی و اطمینان ریاضی نیز هر کدام فقط بخشی از اطمینان واقعی مدل را نشان می‌دهند؛ اطمینانی که در درون مدل بسیار غنی‌تر و چندلایه‌تر از آن است که در یک جمله یا یک عدد خلاصه شود.

گامی به‌سوی عامل‌های هوش مصنوعی قابل‌اعتمادتر

پژوهش اخیر کوماران، داو و همکارانشان می‌تواند راه را برای بررسی‌های بیشتر باز کند تا روشن شود مدل‌های زبانی بزرگ چگونه تصمیم می‌گیرند چه اطلاعاتی را با کاربران به اشتراک بگذارند. این مطالعات می‌توانند به ساخت دستیارهای گفت‌وگویی هوش مصنوعی قابل‌اعتمادتر کمک کنند.

نتیجه کلی این پژوهش آن است که خودداری از پاسخ‌دادن، حاصل کار مشترک دو عامل است: نخست، یک تصویر درونی چندبُعدی از اطمینان یعنی مدل در درون خود، نه فقط یک عدد ساده، بلکه تصویری غنی و چندلایه از میزان اطمینانش به هر پاسخ دارد. دوم، سیاست‌هایی که بر اساس آستانه‌های مشخص تصمیم می‌گیرند یعنی مدل قاعده‌ای درونی دارد که می‌گوید: اگر اطمینانم از این حد کمتر شد، پاسخ نمی‌دهم.

این ساختار با آنچه پژوهشگران کنترل فراشناختی ساختارمند می‌نامند هماهنگ است؛ یعنی مدل ضمن اینکه پاسخ می‌دهد، می‌تواند کیفیت پاسخ خود را ارزیابی کند و بر اساس آن تصمیم بگیرد. چنین ظرفیتی با تبدیل‌شدن مدل‌ها به عامل‌های خودمختار، سامانه‌هایی که باید بدون نظارت انسان تصمیم بگیرند، اهمیت فزاینده‌ای پیدا می‌کند؛ زیرا چنین عامل‌هایی برای مطمئن‌ماندن، باید عدم‌قطعیت خود را تشخیص دهند و در صورت لزوم، از پاسخ‌دادن خودداری کنند.

منبع: حیات

منبع خبرفرهاب سامانه تحلیل اخبار