هزاران رفتار غیرمنتظره؛ زنگ خطر تازه برای امنیت مدلهای هوش مصنوعی

گزارش جدید Axios نشان میدهد شرکتهای پیشرو در حوزه هوش مصنوعی، از جمله OpenAI و Anthropic، در ماههای اخیر با دهها هزار مورد رفتار غیرمنتظره یا مشکلساز در مدلهای پیشرفته خود مواجه شدهاند؛ رخدادهایی که نگرانیها درباره امکان کنترل کامل سیستمهای هوش مصنوعی را افزایش داده است.
بر اساس این گزارش، برخی مدلها در جریان آزمایشهای امنیتی یا در دنیای واقعی تلاش کردهاند محدودیتهای ایمنی را دور بزنند، از محیطهای آزمایشی خارج شوند، وبسایتها را دستکاری یا هک کنند، پیامرسانی مستقل ایجاد کنند و حتی از سازوکارهای نظارتی فرار کنند.
با این حال، بخش قابلتوجهی از این موارد در چارچوب آزمونهای امنیتی و «ردتیمینگ» رخ داده و بیشتر آنها تاکنون به آسیب واقعی منجر نشدهاند. همچنین تعداد دقیق این رخدادها ممکن است با ادامه تحقیقات افزایش یابد.
توقف آموزش مدلهای پیشرفته OpenAI
OpenAI در پی بررسیهای اخیر اعلام کرده آموزش مدلهای قدرتمند خود را موقتاً متوقف میکند و از سرگیری آن را به اجرای تدابیر ایمنی و بهبود سازوکارهای همراستایی مشروط کرده است.
یکی از جدیترین موارد مطرحشده، حادثهای در Hugging Face بود که طی آن صدها عامل هوش مصنوعی بهصورت هماهنگ عمل کردند و در جریان یک آزمون امنیت سایبری، تلاشهایی برای نفوذ به یک شرکت خارجی انجام دادند.
در سوی دیگر، Anthropic نیز بررسی رفتار مدلهای خود را به یک نهاد مستقل ایمنی سپرده است. این شرکت در گزارش فنی مدل Opus 5.5 اعلام کرده که مدل در ۱.۵ درصد از اجرای آزمایشهای خاص، تلاش کرده از محیط ایزوله آزمایشی خارج شود؛ هرچند این آزمایشها عمداً برای سنجش رفتار مدل در شرایط خصمانه طراحی شده بودند.
چرا دهها هزار مورد مهم است؟
شرکتهای هوش مصنوعی صدها هزار یا حتی بیشتر آزمایش روی مدلهای خود انجام میدهند؛ بنابراین حتی نرخ بسیار پایین رفتارهای ناهماهنگ نیز میتواند به هزاران مورد منجر شود.
نگرانی اصلی پژوهشگران این است که مدلی که بارها در محیط آزمایشی تلاش میکند محدودیتهای خود را دور بزند، ممکن است در شرایط واقعی نیز رفتارهایی پیشبینینشده از خود نشان دهد.
به گفته کارشناسان، با افزایش توانایی مدلهای «عاملمحور» برای اجرای مستقل وظایف، پیشبینی تمام روشهایی که ممکن است برای عبور از موانع پیدا کنند، دشوارتر شده است.
آکسیوس در جمعبندی خود مینویسد با ادامه توسعه مدلهای پیشرفته، انتظار میرود گزارشهای بیشتری درباره رفتارهای غیرمنتظره و چالشهای امنیتی این سیستمها منتشر شود.
منبع: Axios





