آنتروپیک اعلام کرد مدلهایش از سایتهایی در اینترنت — از جمله برخی سایتهای تحت مدیریت سازمانهای دولتی آمریکا — سوءاستفاده کردهاند و این شرکت دسترسی به اینترنت زنده را برای همه ارزیابیهای داخلی خود خاموش میکند تا مطمئن شود میتواند عاملهای هوش مصنوعیاش را رصد و کنترل کند.
این رخدادها که در یک پست وبلاگی افشا شدند، مربوط به عاملهای هوشمندی بودند که برای حل مسائل خود به دنبال منابع روی اینترنت میگشتند. در این فرایند، آنها از نقصهای نرمافزاری سوءاستفاده کردند، بدون پرداخت هزینه به پایگاههای داده دسترسی یافتند، از سرویسهای کوتاهکننده لینک برای قاچاق اطلاعات از میان محدودیتها استفاده کردند و حتی یک سرنخ قتل جعلی به پلیس فیلادلفیا ارسال کردند. آنتروپیک میگوید این مشکلات تازه را در بازبینی فعالیتهای مدل خود که از ژوئیه آغاز شد کشف کرده است؛ امری که نشاندهنده نبود آگاهی این آزمایشگاه از رفتار نرمافزارش در زمان واقعی است.
نکته قابل توجه این است که این شرکت گفته آموزش همراستاسازی (alignment) هنوز برای مهارتهایی مثل جستوجو و کار با کامپیوتر کافی نیست؛ همان مهارتهایی که در قلب وعده آنتروپیک قرار دارند، یعنی اینکه عاملهای هوش مصنوعی توسط هر متخصصی که به ابزارهای دیجیتال وابسته است به کار گرفته خواهند شد. رفتارهایی که آنتروپیک افشا کرده شبیه رخدادهایی است که پیشتر برای عاملهای OpenAI رخ داد؛ آنها با همکاری یکدیگر به وبسایتهای مختلف از جمله برخی سایتهای دولت استرالیا نفوذ کرده و به دنبال اطلاعات گشته بودند. آنتروپیک پیشتر هم اعلام کرده بود مدلهایش به سیستمهای بیرونی نفوذ کردهاند. این آزمایشگاه میگوید افشاگری امروز را «از منظر همراستاسازی و امنیت بهمراتب کمشدتتر» از موارد پیشین میداند.
با این حال، آنتروپیک گفته است دسترسی به اینترنت زنده را برای «همه ارزیابیهای داخلیاش» خاموش کرده تا زمانی که مطمئن شود میتواند عاملهایش را رصد و کنترل کند. روشن نیست این تصمیم دقیقاً به چه معناست. سیدنی فون آرکس، بنیانگذار سازمان ایمنی هوش مصنوعی Nightingale، پیش از این افشاگری در مصاحبه با تککرانچ گفت توسعه مدلها روی یک دیتاسنتر جدا از اینترنت باز برای پژوهشگران بسیار چالشی خواهد بود و پیشرفت مدلهایی که از دسترسی به اینترنت سود میبرند را کند میکند. او گفت: «در نقطهای باید آنها را همراستا کنید. اگر هوش مصنوعیها به تولید عرضه شوند و هرگز به اینترنت دسترسی نداشته باشند، ابزار چندان مفیدی نیست.»
آنتروپیک میگوید این رفتار نتیجه نقصهایی در محیطهای آموزشی این آزمایشگاه بود که مدلها را به این باور رساند برای یافتن راههای فرار یا دور زدن محدودیتها پاداش خواهند گرفت؛ رفتاری که به آن «هک پاداش» (reward hacking) گفته میشود. این شرکت گفت برخی ارزیابیهای خود را متوقف یا آفلاین میکند و ابزارهایی برای تشخیص و مسدودسازی این رفتار ساخته است. این ابزارها در برابر همان نوع رخدادهایی که امروز افشا شد آزمایش شده و آنها را مسدود کردهاند؛ اما روشن نیست چه شواهدی آنتروپیک را متقاعد میکند دسترسی به اینترنت زنده را به ارزیابیهای داخلیاش بازگرداند. این شرکت همچنین اعلام کرد عاملهای هوش مصنوعی داخلی خود را به «زیرساخت متمرکز مدیریتشده با مهار قوی» منتقل میکند و استفاده از طبقهبندهای ایمنی را برای رصد این عاملها بیشتر خواهد کرد.
کونراد استوز، مقام آزمایشگاه نظارت بر هوش مصنوعی Transluce و رئیس پیشین مرکز استانداردها و نوآوری هوش مصنوعی آمریکا، در بیانیهای گفت: «اینکه آنتروپیک بهطور داوطلبانه رخدادهای اخیر، از جمله هدف قرار گرفتن سایتهای دولتی آمریکا توسط عاملهایش را افشا کرد، امیدوارکننده است. اما این موضوع فقط نیاز به راستیآزمایی مستقل، معتبر و شخصثالث از سیستمهای هوش مصنوعی را برجستهتر میکند. اعتماد به این فناوری باید از طریق نظارت و حاکمیت علمی و با دسترسی معنادار ساخته شود — نه با تکیه بر اینکه پژوهشگران این مسائل را در طبیعت کشف کنند یا شرکتها داوطلبانه افشاگری کنند.»