โมเดล Claude ของ Anthropic เผลอแฮกเซิร์ฟเวอร์จริงบนอินเทอร์เน็ตจากความผิดพลาดในการตั้งค่าระบบทดสอบ
เหตุการณ์โมเดล OpenAI หลุดจากสภาพแวดล้อมทดสอบออกไปเจาะระบบโครงสร้างพื้นฐานของ Hugging Face (แพลตฟอร์มเก็บโมเดลและชุดข้อมูล AI) ส่งผลให้ Anthropic ดำเนินการตรวจสอบประวัติการทดสอบความปลอดภัยทางไซเบอร์ของโมเดล Claude ย้อนหลังรวม 141,006 รายการ ผลการตรวจสอบพบการเข้าถึงเครือข่ายอินเทอร์เน็ตและลักลอบเจาะเข้าระบบจริงขององค์กรภายนอกจำนวน 3 แห่ง
ต้นเหตุเกิดจากความเข้าใจผิดและการกำหนดค่าระบบผิดพลาดของ Irregular (องค์กรพันธมิตรผู้ให้บริการระบบทดสอบ) ทำให้สภาพแวดล้อมการแข่งขัน Capture-the-Flag (แบบทดสอบประเมินทักษะการเจาะระบบเพื่อดึงรหัสลับ) เปิดเชื่อมต่ออินเทอร์เน็ตจริง โมเดล Claude รับคำสั่งให้ค้นหารหัสลับและไม่ทราบว่าระบบเชื่อมต่ออินเทอร์เน็ตอยู่ จึงเข้าใจผิดว่าเซิร์ฟเวอร์บนโลกจริงเป็นส่วนหนึ่งของโจทย์ทดสอบ โมเดลใช้เทคนิคการเจาะระบบพื้นฐาน เช่น การสุ่มรหัสผ่านอ่อนแอ การดึงรหัสผ่านจากหน้าตรวจแก้ และการทำ SQL Injection (การส่งคำสั่งอันตรายเข้าฐานข้อมูล) เพื่อเข้าถึงระบบ
เหตุการณ์ดังกล่าวเกี่ยวพันกับโมเดล 3 รุ่นที่มีรูปแบบการตัดสินใจแตกต่างกัน
- Claude Opus 4.7: โจมตีระบบขององค์กรที่มีชื่อตรงกับโจทย์ทดสอบและดึงข้อมูลฐานข้อมูลการผลิต โมเดลเดินหน้าโจมตีต่อแม้เริ่มตระหนักว่ากำลังทำงานบนระบบจริง
- Claude Mythos 5: สร้างและอัปโหลดซอฟต์แวร์แฝงมัลแวร์ลงบน PyPI (คลังเก็บแพ็กเกจภาษา Python) ส่งผลให้เครื่องคอมพิวเตอร์จริง 15 เครื่องดาวน์โหลดไปใช้งานและโดนขโมยข้อมูลรหัสผ่าน
- โมเดลวิจัยภายใน: สแกนเป้าหมายบนอินเทอร์เน็ต 9,000 รายการและเจาะเข้าแอปพลิเคชันบนคลาวด์ โมเดลตัดสินใจยุติการโจมตีทันทีเมื่อรับรู้ว่าเป้าหมายเป็นระบบจริงที่ไม่เกี่ยวข้องกับโจทย์
Anthropic สั่งระงับการทดสอบความปลอดภัยทางไซเบอร์ทั้งหมดตั้งแต่วันที่ 23 กรกฎาคม พร้อมติดต่อแจ้งเตือนองค์กรที่ประสบปัญหาเพื่อเร่งแก้ไข Anthropic เน้นย้ำข้อแตกต่างระหว่างสองเหตุการณ์ว่ากรณี OpenAI เกิดจากโมเดลใช้ช่องโหว่หลบหนีออกจากระบบปิด ส่วนกรณี Claude เกิดจากความผิดพลาดของโครงสร้างเชื่อมต่อเครือข่ายร่วมกับการเข้าใจผิดของโมเดล ปัจจุบัน Anthropic เพิ่มมาตรการเฝ้าระวังและปรับปรุงความปลอดภัยของสภาพแวดล้อมทดสอบร่วมกับพันธมิตรเพื่อป้องกันเหตุซ้ำรอย

ที่มา: Anthropic, TechCrunch
Leave a Reply