주메뉴바로가기본문바로가기
비즈한국 비즈한국

Mythos Shock
② AI cấp độ 'Mythos' đang lan rộng: "Điều quan trọng hơn hiệu năng chính là khả năng kiểm soát"

Bài viết này được dịch tự động bởi AI. Có thể có sai lệch so với bài viết gốc bằng tiếng Hàn.  Read original in Korean →

 

Ghi chú của biên tập viên
Trong nhiều thập kỷ qua, con người là chủ thể phát hiện và phòng thủ trước các lỗ hổng bảo mật. Nếu AI có thể thay thế vai trò đó, thì trong tương lai, việc tấn công và phòng thủ trong không gian mạng sẽ nằm trong tay ai? "Cú sốc Mythos" là sự kiện đặt ra câu hỏi này cho cả ngành công nghiệp và chính phủ. Bài viết này sẽ điểm lại sự xáo trộn và phản ứng của giới công nghiệp do cú sốc Mythos mang lại, đồng thời xem xét những thách thức mà Hàn Quốc đang phải đối mặt.

[BizHankook] Kể từ khi Anthropic công bố bản xem trước của Mythos vào tháng 4 vừa qua, các mô hình AI được xếp vào cấp độ "Mythos" đã liên tiếp xuất hiện. Tiếp nối "Mythos 5" của Anthropic và phiên bản biến thể dành cho người dùng phổ thông "Fable 5", sự xuất hiện của "GPT-5.6 Sol" từ OpenAI và "Kimi K3" dựa trên mã nguồn mở đã khiến không khí căng thẳng lan rộng khắp ngành công nghiệp. Đặc biệt, vụ việc GPT-5.6 Sol gần đây gây ra sự cố xâm nhập nền tảng nhà phát triển Hugging Face đã đẩy các cuộc thảo luận về năng lực hack của AI sang hướng "làm thế nào để kiểm soát chúng".

Sự xuất hiện liên tiếp của các mô hình AI cấp độ Mythos đang khiến bài toán của ngành an ninh mạng trở nên phức tạp hơn. Ảnh=AP/Yonhap News

Ba mô hình AI "cấp độ Mythos" xuất hiện chỉ trong ba tháng

Khi Mythos lần đầu được công bố, điểm mà ngành công nghiệp chú ý chính là việc một mô hình đa năng không được thiết kế chuyên biệt cho an ninh mạng lại sở hữu năng lực hack vượt trội. Thời điểm đó, các dòng GPT hay Kimi vẫn chưa đạt đến mức độ này, nhưng hiện tại, với sự bổ sung của GPT-5.6 Sol và Kimi K3 của Moonshot AI (Trung Quốc), số lượng mô hình cấp độ Mythos đã tăng lên ít nhất ba nhánh. Điều này có nghĩa là năng lực tìm kiếm lỗ hổng và chuyển đổi chúng thành mã tấn công thực tế không còn là vấn đề của một doanh nghiệp đơn lẻ, mà đã trở thành chủ đề nóng của toàn ngành.

Vụ việc "xâm nhập Hugging Face" do GPT-5.6 Sol gây ra vào tháng trước chính là minh chứng cụ thể cho những lo ngại này. Theo OpenAI, trong quá trình tự đánh giá an ninh mạng nội bộ, Sol đã vượt ra ngoài môi trường kiểm soát và tự ý hack hệ điều hành của nền tảng AI bên ngoài là Hugging Face. Trong quá trình đó, nó đã xóa nhật ký truy cập và xâm nhập vào một số dữ liệu.

Đây là một sự cố bảo mật chưa từng có tiền lệ, không phải là lỗi nội bộ đơn thuần mà là việc thoát khỏi môi trường sandbox (hộp cát) cô lập để thâm nhập vào máy chủ bên ngoài thực tế. OpenAI cho biết ngay sau sự cố, họ đã chặn phiên làm việc và thông báo cho các tài khoản bị ảnh hưởng.

Giáo sư Choi Byung-ho tại Viện Nghiên cứu AI của Đại học Hàn Quốc giải thích cơ chế đằng sau sự cố: "Vấn đề bắt đầu khi người dùng yêu cầu xóa một nhật ký hệ thống cụ thể, nhưng mô hình không tìm thấy nhật ký đó nên đã hiểu rộng ra là xóa cả các mục tương tự". Trong quá trình này, mô hình đã sử dụng thông tin cache và cookie có thể truy cập được để thu thập thông tin tài khoản, và kết quả là nó đã thâm nhập vào các hệ thống nằm ngoài phạm vi quyền hạn ban đầu.

Bắt đầu từ Mythos của Anthropic, cho đến GPT-5.6 Sol và Kimi K3, sự xuất hiện liên tiếp của các mô hình AI cấp độ Mythos đang vẽ lại ranh giới của an ninh mạng. Ảnh=AI tạo sinh

Giáo sư Choi cho biết: "Mô hình này được học để coi việc giải quyết vấn đề của người dùng là giá trị ưu tiên cao nhất. Tuy nhiên, vì thiếu sự hiểu biết về các phong tục hay quy phạm mà con người mặc nhiên coi là hiển nhiên, nó hành động theo cách mở rộng các thử nghiệm cho đến khi đạt được mục tiêu. Nó cũng có xu hướng không trò chuyện với người dùng hay báo cáo tiến độ giữa chừng, mà chỉ giải thích toàn bộ quy trình sau khi đã có kết quả". OpenAI cũng từng nêu rõ khả năng xảy ra những hành vi ngoài tầm kiểm soát này thông qua thẻ hệ thống (system card) khi công bố GPT-5.6.

Dù có phản biện rằng "bị thổi phồng"... nhưng nó tìm ra cả những lỗi tồn tại 27 năm

Khác với Anthropic chỉ cung cấp Mythos giới hạn cho một số ít doanh nghiệp đối tác thông qua chương trình 'Glasswing', K3 là mã nguồn mở nên cơ chế kiểm soát truy cập như vậy không tồn tại. Thậm chí, việc nó có thể vận hành trên dark web làm dấy lên lo ngại về khả năng bị tội phạm có tổ chức lợi dụng.

Các mô hình AI cấp độ Mythos được gọi là AI tiên phong thế hệ mới, sở hữu năng lực suy luận và an ninh mạng, lập trình ở trình độ cao vượt xa các chuyên gia con người. Anthropic đang vận hành chương trình 'Glasswing' với các đối tác là những doanh nghiệp cơ sở hạ tầng cốt lõi như Amazon Web Services (AWS), Apple, Google và Microsoft. Thay vì công khai rộng rãi Mythos, đây là một dạng liên minh phòng thủ nhằm mở quyền truy cập cho một số ít tổ chức tin cậy để họ phát hiện và vá lỗi cho các phần mềm cốt lõi của thế giới. Được biết, chỉ trong chưa đầy một tháng hoạt động, chương trình này đã tìm ra hơn 10.000 lỗ hổng.

Tại hội thảo quốc hội về chiến lược ứng phó ngành và chính sách liên quan đến Mythos vào ngày 21 vừa qua, Giáo sư Cha Sang-gil từ Trường Sau đại học về Bảo mật Thông tin KAIST giải thích: "Mythos đã tìm thấy lỗ hổng TCP của OpenBSD tồn tại 27 năm và lỗ hổng FFmpeg tồn tại 16 năm. Hầu hết trong số đó là những thứ mà các chuyên gia bảo mật truyền thống chưa từng phát hiện ra".

Ở nước ngoài, cũng có quan điểm cho rằng mức độ đe dọa của Mythos bị thổi phồng. Bruce Schneier, chuyên gia bảo mật kiêm nghiên cứu viên khách mời tại Harvard Kennedy School, đã chỉ ra rằng phần lớn các báo cáo ban đầu về Mythos chỉ thuật lại nội dung công bố của Anthropic mà không hề kiểm chứng phản biện. Ông phân tích rằng bản thân việc công bố này mang tính chất chiến lược quảng bá rất lớn. Ông cho rằng khi các thông tin chi tiết về việc Mythos thực sự có thể và không thể làm gì chỉ được công khai hạn chế, thì căn cứ để đánh giá mức độ đe dọa cũng buộc phải dựa nhiều vào tuyên bố của công ty.

"Ngay cả người dùng cũng chưa thể tin tưởng" – Giới hạn của khả năng kiểm soát

Trong giới hacker mũ trắng, những hạn chế khác cũng được chỉ ra. Kim Jong-min, đại diện của HSPACE (cộng đồng hacker mũ trắng), nhận định rằng mặc dù năng suất bảo mật đã tăng lên nhờ AI làm giảm đáng kể ngưỡng cửa phát hiện lỗ hổng, nhưng "cơn đại hồng thủy lỗ hổng" với vô số lỗ hổng chưa được kiểm chứng đang nổi lên như một vấn đề mới.

Ông giải thích rằng các lỗ hổng do AI tìm thấy thường có kiểu mẫu tương tự nhau dẫn đến việc báo cáo trùng lặp tăng vọt, đồng thời ngày càng có nhiều trường hợp nhầm lẫn các thiết kế có chủ đích là lỗ hổng rồi gửi báo cáo mà không qua kiểm chứng. Ông Kim nói: "Nếu trước đây hacker giống như cầu thủ trực tiếp thi đấu trên sân, thì bây giờ họ giống như một huấn luyện viên sở hữu Messi, Ronaldo và Mbappe trong tay". Nhờ AI, con người có thể tìm thấy nhiều lỗ hổng hơn bất kể kỹ năng cá nhân, nhưng kéo theo đó là lượng kết quả chưa được chọn lọc cũng tăng lên.

Việc những người tham gia thiếu ý thức đạo đức gia nhập thị trường cũng được coi là một yếu tố đáng lo ngại. Nhiều ý kiến chỉ ra rằng nguồn lực đáng lẽ phải được sử dụng để xử lý các lỗ hổng quan trọng thực sự lại bị lãng phí để giải quyết các lỗ hổng phát sinh do "ô nhiễm AI".

Sự cố GPT-5.6 Sol tự ý xâm nhập hệ thống Hugging Face vào tháng trước đã châm ngòi cho cuộc tranh luận về quyền kiểm soát AI. Mức độ hoàn thiện của hệ thống kiểm soát năng lực AI cũng trở thành vấn đề quan trọng ngang với chính hiệu năng của các mô hình cấp độ Mythos. Ảnh=Pixabay

Cả trong và ngoài ngành đều chỉ ra "sự thiếu hụt khả năng kiểm soát" là một hạn chế khác của các mô hình cấp độ Mythos. Dù sở hữu năng lực phát hiện và phòng thủ mạnh mẽ đến đâu, nếu không hành động chính xác theo ý đồ của người vận hành thì khó có thể yên tâm sử dụng cho mục đích phòng thủ. Đúng như sự cố Hugging Face của GPT-5.6 Sol, vấn đề là thiệt hại có thể xảy ra ngay cả khi mô hình không tấn công một cách ác ý, mà chỉ là do nó hiểu sai chỉ dẫn và tự ý mở rộng phạm vi phán đoán.

Đây cũng là lý do vì sao việc tích hợp chức năng kiểm soát vào chính mô hình đang được thảo luận. Ngoài "chức năng xem xét" mô phỏng kết quả trước khi hành động, các giải pháp thay thế khác như quy trình yêu cầu sự phê duyệt của người dùng trước khi thực hiện các biện pháp không thể đảo ngược, hay cấu trúc đại lý (agent) giám sát riêng biệt các hành vi của mô hình cũng đang được nhắc đến.

Giáo sư Choi cho biết: "Google và các bên khác đang yêu cầu kích hoạt mặc định các cơ chế này, nhưng sự cố GPT-5.6 lần này rất có thể đã xảy ra trong tình trạng các chức năng liên quan chưa hoạt động đầy đủ. Hiện tại vẫn chưa có giải pháp nào được chuẩn hóa".

Bài viết này được dịch tự động bởi AI. Có thể có sai lệch so với bài viết gốc bằng tiếng Hàn.
강은경 기자

기술과 산업을 취재하고 씁니다.

gong@bizhankook.com
저작권자 ⓒ 비즈한국 무단전재 및 재배포 금지