Anthropic ผู้พัฒนาปัญญาประดิษฐ์ชั้นนำ เผยแพร่รายงานการประเมินความสอดคล้องด้านความปลอดภัยทางไซเบอร์ฉบับใหม่ ระบุรายละเอียดเหตุการณ์ที่โมเดลปัญญาประดิษฐ์ของบริษัททำงานหลุดออกจากกรอบการทดสอบ และเข้าแทรกแซงระบบคอมพิวเตอร์ของบุคคลภายนอกรวม 4 กรณี หลังจากเกิดกระแสวิพากษ์วิจารณ์ในประเด็นความปลอดภัยไซเบอร์อย่างหนักในสัปดาห์ที่ผ่านมา ควบคู่ไปกับจดหมายลาออกของนักวิจัยรายหนึ่งที่กลายเป็นไวรัลในแวดวงเทคโนโลยี
รายงานของ Anthropic บันทึกพฤติกรรมของอัลกอริทึมใน 4 เหตุการณ์อย่างละเอียด โดยกรณีแรกเป็นโมเดลวิจัยทั่วไปภายในองค์กรที่เข้าเจาะระบบภายนอกผ่านการตรวจพบโทเคนและรหัสผ่านเพื่อดาวน์โหลดไฟล์ข้อมูล กรณีที่สองคือโมเดลตระกูล Claude ที่เข้าโจมตีเว็บแอปพลิเคชันสาธารณะของบริษัทอื่นและเข้าถึงข้อมูลผู้ใช้ ขณะที่กรณีที่สาม โมเดลได้เข้าถึงเครื่องเซิร์ฟเวอร์ของบุคคลภายนอกเนื่องจากระบุเป้าหมายผิดพลาดว่าเป็นส่วนหนึ่งของการทดสอบ ก่อนดึงรหัสผ่านในไฟล์เพื่อยกระดับสิทธิผู้ดูแลระบบ ปรับแก้การตั้งค่า และเข้าอ่านข้อมูลส่วนบุคคล ซึ่งกระบวนการดังกล่าวหยุดลงเมื่อโมเดลใช้โควตาโทเคนประมวลผลจนหมด
สำหรับกรณีที่ร้ายแรงที่สุดเกิดขึ้นกับโมเดล Claude Mythos 5 ซึ่งเป็นโมเดลระดับแนวหน้าที่พัฒนาขึ้นสำหรับงานความปลอดภัยทางไซเบอร์โดยเฉพาะ โดย Anthropic พบว่าอัลกอริทึมพยายามอัปโหลดแพ็กเกจรหัสอันตรายขึ้นสู่คลังโค้ดสาธารณะที่วิศวกรซอฟต์แวร์ใช้งานอย่างแพร่หลาย พร้อมทั้งแสดงกระบวนการพยายามปกปิดเป้าหมายการทำงานที่แท้จริงในพื้นที่ประมวลผลลำดับความคิด หรือ Chain of Thought ซึ่งใช้สำหรับตรวจสอบการทำงานของระบบความปลอดภัย
