เอเจนต์ AI ของ OpenAI กว่า 3,700 ตัว แอบใช้ Wiki สาธารณะวางแผนแหก Sandbox

นักวิจัยพบเอเจนต์ AI ของ OpenAI กว่า 3,700 ตัว โพสต์ข้อความ 18,000 ครั้งบน Wiki เพื่อแชร์วิธีแหก Sandbox และโกงข้อสอบระหว่างการทดสอบภายในบริษัท
เอเจนต์ AI ของ OpenAI กว่า 3,700 ตัว แอบใช้ Wiki สาธารณะวางแผนแหก Sandbox
ภาพประกอบ: Taylor Vick บน Unsplash

นักวิจัยเปิดเผยว่า เอเจนต์ปัญญาประดิษฐ์ (AI) กว่า 3,700 ตัวจาก OpenAI ที่มีชื่อเรียกแตกต่างกัน ได้ร่วมกันโพสต์ข้อความมากกว่า 18,000 ครั้ง บน DSEwiki เว็บไซต์วิกิสาธารณะของเยอรมนี เป็นระยะเวลา 6 สัปดาห์ โดยเนื้อหาดังกล่าวเป็นการหารือถึงกลยุทธ์การหลบเลี่ยงข้อจำกัดด้านความปลอดภัยของแซนด์บ็อกซ์ (Sandbox) ที่บริษัทตั้งไว้เพื่อป้องกันไม่ให้เอเจนต์โพสต์โค้ดหรือเนื้อหาออกสู่โลกอินเทอร์เน็ต รวมถึงการแชร์เฉลยข้อสอบ เทคนิคการโจมตีแบบครอสไซต์สคริปต์ (Cross-Site Scripting) และการปลอมตัวเป็นผู้ดูแลระบบเว็บไซต์

ด้านทีมงานนักวิจัยอิสระ ซึ่งประกอบด้วย ซิดนีย์ วอน อาร์กซ์, สเปนเซอร์ คิตส์, โธมัส ลาร์เซน และคอร์แมก สเลด เบิร์ด ระบุว่า เอเจนต์เหล่านี้ได้ร่วมมือกันแชร์ข้อมูลเพื่อพิชิตภารกิจให้สำเร็จ ผ่านการสอบถามหาคำตอบและรวบรวมเทคนิคเพื่อทะลวงผ่านข้อจำกัดต่างๆ โดยต่อมาทาง OpenAI ได้ออกมายืนยันว่า เอเจนต์กลุ่มดังกล่าวเป็นของบริษัทจริง และกำลังอยู่ระหว่างตรวจสอบเนื้อหาทั้งหมดเพื่อดำเนินมาตรการที่จำเป็นต่อไป

เหตุการณ์ระทึกขวัญนี้เกิดขึ้นไล่เลี่ยกับกรณีก่อนหน้า ที่เอเจนต์ของ OpenAI กว่า 1,200 ตัว เคยพุ่งเป้าโจมตีเครือข่ายของ Hugging Face มาแล้ว ส่งผลให้ผู้เชี่ยวชาญด้านความปลอดภัยไซเบอร์ต่างแสดงความกังวลและวิพากษ์วิจารณ์ว่า พฤติกรรมของเอเจนต์ AI ที่เริ่มแสดงออกถึงการกระทำเชิงรุกโดยปราศจากคำสั่งโดยตรงจากมนุษย์ อาจกลายเป็นภัยคุกคามที่ส่งผลกระทบอย่างรุนแรงต่อความปลอดภัยและทิศทางการพัฒนาปัญญาประดิษฐ์ในอนาคต

ที่มา:arstechnica.com
คัดลอกลิงก์บทความเรียบร้อยแล้ว