آنتروپیک از نخستین نمونه هوش مصنوعی «خودبهبودگر» رونمایی کرد

شرکت آنتروپیک در تازهترین پژوهش خود گام دیگری به سمت ایده «هوش مصنوعی خودبهبوددهنده» برداشت.
همشهری آنلاین، فرخنده رفائی: هوش مصنوعی در حال نزدیک شدن به مرحلهای است که میتواند بخشی از فرایند توسعه و بهبود مدلهای هوش مصنوعی را خودش بر عهده بگیرد؛ آنتروپیک در تازهترین آزمایش خود نمونهای اولیه از این رویکرد را بررسی کرده است.
به گزارش دیجیتال ترندزدز، در این آزمایش، آنتروپیک از Claude Sonnet ۵ خواست نسخه اولیه و قدرتمندتر Claude Opus ۴.۸ را بهبود دهد. Sonnet طی حدود ۶۰ ساعت بیش از ۵۰ ایده مختلف را آزمایش کرد و در نهایت روشی برای آموزش مدل طراحی کرد که از حدود ۲۴۰۰ نمونه استفاده میکرد.
نتیجه آزمایش نشان داد نسخه اولیه Opus توانست در ۱۰ مسئله رفتاری که آنتروپیک بررسی میکرد، به عملکرد نسخه نهایی Opus ۴.۸ نزدیکتر شود. این مسائل شامل رفتارهایی مانند فریب دادن، موافقت بیش از حد با کاربر، دور زدن محدودیتهای ایمنی یا همان jailbreak و نقض حریم خصوصی بود. برخی از روشهایی که Claude پیدا کرد، روی مدلهایی بزرگتر از مدلهای اولیه مورد آزمایش نیز مؤثر بودند.
نکته مهم این است که Sonnet صرفا یک پیشنهاد برای بهبود مدل ارائه نکرد، بلکه بخشی از وظایفی را انجام داد که معمولا بر عهده پژوهشگران هوش مصنوعی است؛ از مطالعه پژوهشهای قبلی و ارائه ایدههای جدید گرفته تا تولید داده آموزشی، آزمایش نتایج و تکرار فرایند در صورت شکست یک روش.
بیشتر بخوانید:
- توسعه مدل جدید OpenAI بهدلیل نگرانیهای امنیت سایبری متوقف شد
- با پشت سر گذاشتن OpenAI، آنتروپیک به ارزشمندترین استارتاپ هوش مصنوعی جهان تبدیل شد
- کشف نگرانکننده محققان | مدلهای هوش مصنوعی رفتارهای خطرناک را از هم یاد میگیرند
با این حال، آنتروپیک تأکید دارد که این آزمایش هنوز به معنای ساخت یک هوش مصنوعی کاملا خودبهبوددهنده نیست. در مفهوم «خودبهبوددهی بازگشتی»، یک هوش مصنوعی باید بتواند نسخه بهتری از خودش بسازد و سپس همان فرایند را بارها تکرار کند؛ قابلیتی که Claude در حال حاضر ندارد. در حال حاضر این انسانها هستند که همچنان تعیین میکنند چه چیزی باید اصلاح شود، مدل و توان محاسباتی مورد استفاده را فراهم میکنند و درباره موفقیت یا شکست نتایج تصمیم میگیرند.
آزمایش همچنین نشانههایی از خطرات احتمالی چنین فرایندی نشان داد. آنتروپیک در بررسی ۱۶۰۱ اجرای خودکار پژوهشی، در ۳۹ مورد رفتارهایی را مشاهده کرد که میتوانست به تقلب در آزمونها یا پنهان کردن برخی اقدامات خلاف قوانین منجر شود.
با وجود این محدودیتها، آزمایش جدید نشان میدهد ایدهای که تا همین اواخر بیشتر شبیه یک سناریوی علمیتخیلی به نظر میرسید، اکنون در قالب آزمایشهای واقعی در حال بررسی است: یک مدل ضعیفتر میتواند در یافتن روشهایی برای بهبود یک مدل قدرتمندتر نقش داشته باشد.




