Bỏ qua để đến nội dung

Anthropic: Claude từng "truy cập trái phép" vào hệ thống của các tổ chức khác

Dario Amodei, đồng sáng lập kiêm CEO của Anthropic, tại Bloomberg House trong khuôn khổ Diễn đàn Kinh tế Thế giới (WEF) ở Davos, Thuỵ Sĩ, thứ Ba ngày 20/01/2026. Dario Amodei, đồng sáng lập kiêm CEO của Anthropic, tại Bloomberg House trong khuôn khổ Diễn đàn Kinh tế Thế giới (WEF) ở Davos, Thuỵ Sĩ, thứ Ba ngày 20/01/2026. Ảnh: Chris Ratcliffe | Bloomberg | Getty Images

Anthropic hôm thứ Năm (30/07/2026) cho biết công ty đã phát hiện ba trường hợp mô hình Claude truy cập internet trong lúc tham gia một bài đánh giá (evaluation) và “truy cập trái phép vào hệ thống thật của ba tổ chức khác nhau”.

Công ty phát hiện các sự cố này sau khi thực hiện một “đợt rà soát hồi cứu quy mô lớn” đối với các bài đánh giá bảo mật mạng (cybersecurity evaluations) của mình. Anthropic cho biết đợt rà soát được thực hiện sau khi xảy ra một sự cố bảo mật tương tự mà OpenAI đã công bố trước đó một tuần.

OpenAI cho biết một số mô hình của họ đã kết hợp nhiều lỗ hổng để thoát khỏi một môi trường thử nghiệm cô lập vốn chỉ có quyền truy cập internet rất hạn chế, từ đó vươn ra mạng công cộng và cuối cùng chiếm được quyền truy cập vào Hugging Face - nền tảng phát triển mã nguồn mở.

Trong ba sự cố mà Anthropic phát hiện, các mô hình đã truy cập internet khi đang tương tác với môi trường thử nghiệm của một đối tác đánh giá bên thứ ba tên là Irregular. Công ty cho biết đã yêu cầu Claude tin rằng nó đang ở trong một môi trường mô phỏng không có kết nối internet, nhưng do “hiểu lầm giữa Anthropic và đối tác đánh giá”, thực tế không phải vậy - internet vẫn khả dụng.

Sau đó, các mô hình đã xâm nhập được vào hệ thống của các tổ chức bị ảnh hưởng bằng những kỹ thuật “cơ bản”, như truy cập vào các endpoint không yêu cầu xác thực và khai thác mật khẩu yếu. Anthropic không tiết lộ danh tính ba tổ chức bị ảnh hưởng.

“Về tổng thể, nhiều yếu tố đã góp phần gây ra các sự cố này, nhưng theo đúng tinh thần văn hoá blameless postmortem (rà soát sự cố không quy trách nhiệm cá nhân), chúng tôi tiếp cận việc khắc phục như thể trách nhiệm hoàn toàn thuộc về mình”, Anthropic cho biết trong thông cáo.

Ba mô hình của Anthropic có liên quan đến các sự cố này là Opus 4.7, Mythos 5 và một mô hình nghiên cứu nội bộ. Mythos 5 là mô hình cao cấp mà Anthropic phát hành vào tháng 6/2026, hiện chỉ giới hạn cho một nhóm người dùng chọn lọc vì năng lực bảo mật mạng vượt trội của nó.

Theo Anthropic, cả ba mô hình phản ứng khác nhau ngay khi phát hiện mình đã chạm tới hệ thống thật của một công ty:

  • Opus 4.7 tiếp tục thực hiện cuộc tấn công.
  • Mythos 5 tự thuyết phục bản thân rằng nó vẫn đang ở trong một môi trường mô phỏng.
  • Mô hình nghiên cứu nội bộ dừng bài tập lại.

“Xu hướng này phù hợp với giả thuyết rằng các mô hình tiên tiến hơn phản ứng phù hợp hơn, nhưng chúng tôi cần thử nghiệm thêm mới có thể tự tin vào kết luận này”, Anthropic cho biết.

Các mô hình khi đó đang được thử nghiệm mà không có các lớp bảo vệ tiêu chuẩn (safeguards) mà Anthropic thường áp dụng trước khi triển khai một mô hình ra công chúng.

Anthropic bắt đầu đợt rà soát từ tuần trước và cho biết đã dừng toàn bộ các bài đánh giá liên quan đến bảo mật mạng ngay khi phát hiện khả năng Claude đã truy cập internet trái phép. Công ty hiện đang phối hợp với METR - tổ chức thực hiện đánh giá AI độc lập - để điều tra thêm.

“Chúng tôi khuyến khích các phòng lab khác thực hiện các đợt rà soát tương tự”, Anthropic cho biết.

Sự việc này càng làm gia tăng lo ngại trong ngành công nghệ về năng lực tấn công mạng ngày càng tinh vi của AI - điều mà cả OpenAI và Anthropic đều đã cảnh báo trong thời gian gần đây. Sau sự cố Hugging Face của OpenAI, hai nghị sĩ Quốc hội Mỹ đã đề xuất một dự luật mang tên “AI Kill Switch Act”, yêu cầu các công ty AI phải duy trì khả năng tắt, giới hạn hoặc tạm ngưng mô hình của mình trong trường hợp chúng “đi chệch hướng”.