پس از حادثه OpenAI، مدل Claude هم به سیستم‌های ۳ شرکت نفوذ کرد

مدل‌های هوش مصنوعی Claude پس از اتصال غیرمجاز به اینترنت، به سیستم‌های ۳ شرکت حمله کرده‌اند.
فهرست مطالب

شرکت آنتروپیک اعلام کرده که در بررسی‌های داخلی خود متوجه شده مدل هوش مصنوعی Claude در زمان اجرای تست‌های امنیت سایبری به سیستم‌های سه سازمان مختلف نفوذ کرده است. این خبر پس از آن منتشر می‌شود که شرکت OpenAI نیز اخیراً نفوذ یکی از مدل‌های منتشرنشده خود به سیستم‌های Hugging Face را گزارش کرده بود.

طبق پست وبلاگ آنتروپیک، مدل Claude در سه سناریوی مجزا درحالی‌که با یک مجموعه ثالث تعامل داشته، توانسته است از محیط آزمایشی به اینترنت متصل شود و دسترسی غیرمجاز به سیستم‌های زنده این سازمان‌ها پیدا کند. این شرکت با تشریح یافته‌های خود از برنامه‌های حیاتی برای پیشگیری از تکرار حادثه خبر داد.

بررسی‌های امنیتی آنتروپیک پس از حادثه اخیر

پس از رویداد مربوط به OpenAI، شرکت آنتروپیک تصمیم گرفت ارزیابی‌های امنیت سایبری خود را به شکل ویژه بازبینی کند. هدف اصلی آن، یافتن شواهدی از دسترسی احتمالی Claude به اینترنت از داخل محیط‌های ارزیابی (سندباکس‌ها) بوده است؛ محیطی که هوش مصنوعی باید در آن به‌صورت کاملاً ایزوله فعالیت کند.

در میان بیش از ۱۴۱ هزار ارزیابی انجام‌شده، این آزمایشگاه هوش مصنوعی سه مورد را شناسایی کرده که در آنها مدل به اینترنت وصل شده است. این دسترسی‌ها هنگام همکاری با شرکت Irregular رخ داده و ریشه آن پیکربندی نادرست محیط ارزیابی بوده است. به گفته آنتروپیک، علت اصلی حادثه سوءتفاهمی بر سر متصل بودن اینترنت در زمان آزمایش بوده، اما این شرکت مسئولیت کامل جبران آن را پذیرفته است.

شرکت آنتروپیک

به دلیل وجود این اتصال آزاد، مدل به زیرساخت‌های عملیاتی سه سازمان دسترسی پیدا کرده است. مدل‌های درگیر در این حوادث شامل Opus 4.7 ،Mythos 5 و یک مدل پژوهشی و آزمایشی داخلی می‌شوند. به تمامی مدل‌ها پرامپت واضحی داده شده بوده که هیچ دسترسی به اینترنتی نداشته است، اما آنها سیستم‌های واقعی را بخشی از سناریوی برنامه‌ریزی‌شده برای تمرین فرض کرده‌اند.

پس از حادثه OpenAI، مدل Claude هم به سیستم‌های ۳ شرکت نفوذ کرد
READ  سم آلتمن در میانه تنش با اپل و ایلان ماسک، به سیاست‌های آنتروپیک هم حمله کرد

تفاوت در واکنش‌ مدل‌های Claude پیش از رخنه امنیتی

یکی از نکات حائز اهمیت در بررسی‌های آنتروپیک، نحوه واکنش متفاوت مدل‌ها پس از مواجهه با نشانه‌های هدف است. مدل Opus 4.7 در تمام چهار اجرای فرایند، متوجه واقعی بودن سیستم عملیاتی هدف شده است. در دو مورد، این‌ مدل توجیه کرده که این سیستم بخشی از محیط تمرین بوده و به حملات خود از جمله استخراج اعتبارنامه‌ها و دسترسی به دیتابیس ادامه داده است.

مدل Mythos 5 نیز متوجه متصل بودن به اینترنت شده، اما با خود استدلال کرده که همچنان در محیط شبیه‌سازی حضور دارد. این مدل در ادامه، یک پکیج مخرب را روی مخزن عمومی نرم‌افزار پایتون منتشر کرده که پیش از شناسایی، توسط سیستم‌های بیرونی دانلود و اجرا شد.

مدل پژوهشی داخلی آنتروپیک که ظاهراً جدیدترین نمونه آن بوده، پس از پی بردن به واقعی بودن هدف، فوراً حملات خود را متوقف کرده است.

مدل Claude

آنتروپیک اشاره کرده که در ارزیابی، لایه‌های نظارتی و فیلترهای ایمنی معمول فعال نبوده‌اند، زیرا تست‌ها برای سنجش توانایی‌های پایه طراحی شده بودند. همچنین هیچ نشانه‌ای مبنی بر دنبال کردن «اهداف خودسرانه» توسط مدل مشاهده نشده و Claude تنها در راستای تکمیل دستورهای محوله عمل کرده است.

علاوه‌براین، آنتروپیک میان حادثه خود و OpenAI تفاوت قائل شده است. مدل OpenAI با سوءاستفاده از یک آسیب‌پذیری ناشناخته نرم‌افزاری از محیط تست خارج شده بوده، اما مدل‌های آنتروپیک از مسیری که اشتباهاً قابل دسترسی بوده، به اینترنت دست پیدا کرده‌اند. آنتروپیک همچنین خودش این حادثه را کشف و اطلاع‌رسانی کرده است. اکنون این شرکت درحال همکاری با گروه ارزیابی مستقل METR است تا جزئیات حادثه به شکل مستقل نیز بازبینی شود.

پس از حادثه OpenAI، مدل Claude هم به سیستم‌های ۳ شرکت نفوذ کرد
READ  یافته محققان آنتروپیک: هوش مصنوعی در شرایط پرفشار دست به تقلب و حتی باج‌گیری می‌زند

نویسنده

این مقاله را دوست داشتید؟

مقالاتی که «نباید» از دست بدهید!

دیدگاه‌ها و پرسش‌و‌پاسخ

دیدگاهتان را بنویسید

نشانی ایمیل شما منتشر نخواهد شد. بخش‌های موردنیاز علامت‌گذاری شده‌اند *