Anthropic เผยแพร่รายงานข่าวกรองภัยคุกคามฉบับใหม่ ระบุว่าตรวจพบการโจมตีเพื่อกลั่นกรองข้อมูล (Distillation Attacks) อย่างต่อเนื่องจากบริษัทปัญญาประดิษฐ์ในประเทศจีน ซึ่งทวีความรุนแรงขึ้นในช่วงไม่กี่เดือนที่ผ่านมา โดยมีเป้าหมายเพื่อหลบเลี่ยงระบบป้องกันและดึงความสามารถหลักของโมเดล Claude เช่น ความสามารถด้านเอเจนต์ (Agentic Capabilities) การใช้เครื่องมือ การเขียนโค้ด การวิเคราะห์ข้อมูล และการคิดเชิงตรรกะ ไปใช้งานโดยไม่ได้รับอนุญาต
รายงานระบุว่า การโจมตีดังกล่าวเน้นการดึงข้อมูลกระบวนการคิด (Chain of Thought) จากการตอบคำถามของโมเดล เพื่อนำไปใช้เทรนโมเดลขนาดเล็กผ่านกระบวนการปรับแต่งอย่างละเอียดแบบมีผู้สอน (Supervised Fine-Tuning) แม้ว่า Anthropic จะปิดกั้นไม่ให้ผู้ใช้ทั่วไปเข้าถึงกระบวนการคิดภายในโดยตรง แต่ผู้โจมตีได้ใช้วิธีการหลอกล่อด้วยพรอมต์ เช่น การสั่งให้โมเดลแปลข้อมูลหน่วยความจำที่ทำงานอยู่ก่อนหน้าให้เป็นภาษาญี่ปุ่นอักษรคาตาคานะ เพื่อบังคับให้โมเดลคายกระบวนการคิดออกมาโดยตรง
แคมเปญที่ใหญ่ที่สุดมาจาก Alibaba ซึ่ง Anthropic ตรวจพบการแลกเปลี่ยนข้อมูลถึง 151 ล้านครั้งระหว่างเดือนพฤษภาคมถึงกรกฎาคม ค.ศ. 2026 ผ่านบัญชีผู้ใช้งานกว่า 3,500 บัญชีที่ใช้พรอมต์รูปแบบเดียวกันเพื่อนำข้อมูลไปเทรนโมเดลตระกูล Qwen ขณะที่แคมเปญของ Moonshot AI ผู้พัฒนาแอปพลิเคชัน Kimi มีการส่งคำขอเกือบ 300,000 ครั้งผ่านบัญชี 5,000 บัญชีเพื่อพุ่งเป้าไปที่โมเดล Claude Opus โดยพบว่าบางคำขอมีลักษณะเชื่อมโยงกับกองทัพจีน เช่น การสั่งให้ประเมินพฤติกรรมผิดปกติจากภาพกล้องวงจรปิด
