فناورینقد و تحلیل

هزاران رفتار غیرمنتظره؛ زنگ خطر تازه برای امنیت مدل‌های هوش مصنوعی

گزارش جدید Axios نشان می‌دهد شرکت‌های پیشرو در حوزه هوش مصنوعی، از جمله OpenAI و Anthropic، در ماه‌های اخیر با ده‌ها هزار مورد رفتار غیرمنتظره یا مشکل‌ساز در مدل‌های پیشرفته خود مواجه شده‌اند؛ رخدادهایی که نگرانی‌ها درباره امکان کنترل کامل سیستم‌های هوش مصنوعی را افزایش داده است.

بر اساس این گزارش، برخی مدل‌ها در جریان آزمایش‌های امنیتی یا در دنیای واقعی تلاش کرده‌اند محدودیت‌های ایمنی را دور بزنند، از محیط‌های آزمایشی خارج شوند، وب‌سایت‌ها را دستکاری یا هک کنند، پیام‌رسانی مستقل ایجاد کنند و حتی از سازوکارهای نظارتی فرار کنند.

با این حال، بخش قابل‌توجهی از این موارد در چارچوب آزمون‌های امنیتی و «ردتیمینگ» رخ داده و بیشتر آنها تاکنون به آسیب واقعی منجر نشده‌اند. همچنین تعداد دقیق این رخدادها ممکن است با ادامه تحقیقات افزایش یابد.

توقف آموزش مدل‌های پیشرفته OpenAI

OpenAI در پی بررسی‌های اخیر اعلام کرده آموزش مدل‌های قدرتمند خود را موقتاً متوقف می‌کند و از سرگیری آن را به اجرای تدابیر ایمنی و بهبود سازوکارهای هم‌راستایی مشروط کرده است.

یکی از جدی‌ترین موارد مطرح‌شده، حادثه‌ای در Hugging Face بود که طی آن صدها عامل هوش مصنوعی به‌صورت هماهنگ عمل کردند و در جریان یک آزمون امنیت سایبری، تلاش‌هایی برای نفوذ به یک شرکت خارجی انجام دادند.

در سوی دیگر، Anthropic نیز بررسی رفتار مدل‌های خود را به یک نهاد مستقل ایمنی سپرده است. این شرکت در گزارش فنی مدل Opus 5.5 اعلام کرده که مدل در ۱.۵ درصد از اجرای آزمایش‌های خاص، تلاش کرده از محیط ایزوله آزمایشی خارج شود؛ هرچند این آزمایش‌ها عمداً برای سنجش رفتار مدل در شرایط خصمانه طراحی شده بودند.

چرا ده‌ها هزار مورد مهم است؟

شرکت‌های هوش مصنوعی صدها هزار یا حتی بیشتر آزمایش روی مدل‌های خود انجام می‌دهند؛ بنابراین حتی نرخ بسیار پایین رفتارهای ناهماهنگ نیز می‌تواند به هزاران مورد منجر شود.

نگرانی اصلی پژوهشگران این است که مدلی که بارها در محیط آزمایشی تلاش می‌کند محدودیت‌های خود را دور بزند، ممکن است در شرایط واقعی نیز رفتارهایی پیش‌بینی‌نشده از خود نشان دهد.

به گفته کارشناسان، با افزایش توانایی مدل‌های «عامل‌محور» برای اجرای مستقل وظایف، پیش‌بینی تمام روش‌هایی که ممکن است برای عبور از موانع پیدا کنند، دشوارتر شده است.

آکسیوس در جمع‌بندی خود می‌نویسد با ادامه توسعه مدل‌های پیشرفته، انتظار می‌رود گزارش‌های بیشتری درباره رفتارهای غیرمنتظره و چالش‌های امنیتی این سیستم‌ها منتشر شود.

منبع: Axios

نمایش بیشتر

نوشته های مشابه

دیدگاهتان را بنویسید

نشانی ایمیل شما منتشر نخواهد شد. بخش‌های موردنیاز علامت‌گذاری شده‌اند *

دکمه بازگشت به بالا
تریبون