Khi 'Rào Chắn An Toàn' Của AI Cản Trở Công Việc Của Nhà Nghiên Cứu An Ninh Mạng
Trong nhiều tháng qua, các ông lớn AI đã phát triển các chương trình được kiểm định đặc biệt và các “rào chắn an toàn” (guardrails) nghiêm ngặt nhằm hạn chế việc tin tặc độc hại sử dụng các mô hình của họ. Tuy nhiên, những giới hạn này hiện đang cản trở công việc của cả những người bảo vệ mạng hợp pháp lẫn các nhà nghiên cứu an ninh mạng tấn công (offensive cybersecurity researchers).
Vào tháng 6, chính phủ Hoa Kỳ đã áp đặt các hạn chế kiểm soát xuất khẩu đối với các mô hình AI được quảng bá rầm rộ của Anthropic là Mythos và Fable. Động thái này một phần xuất phát từ một báo cáo cho rằng có thể vượt qua các rào chắn của mô hình, vốn được thiết kế để ngăn người dùng sử dụng chúng tạo ra và thực hiện các cuộc tấn công mạng độc hại. Bất kể liệu sự cố này có thực sự xuất phát từ nỗi sợ bị “jailbreak” hay không, thực tế là Anthropic đã nhiều lần quảng bá Mythos như một loại “cỗ máy tận thế mạng” chỉ có thể giao cho những người dùng được kiểm duyệt cẩn thận, và ngay cả khi đó vẫn có các rào chắn nghiêm ngặt. (Các biện pháp kiểm soát xuất khẩu đối với Fable 5 và Mythos 5 đã được dỡ bỏ sau đó. Fable 5 đã trở lại quyền truy cập chung vào ngày 1 tháng 7; Mythos 5 chỉ được giới thiệu lại cho các tổ chức được kiểm duyệt tại Hoa Kỳ như một phần của quy trình đánh giá của chính phủ.)
Kiểu “kiểm soát cổng” này không chỉ độc quyền ở Mythos. Cả Anthropic, với các mô hình khác của mình, và OpenAI đều cung cấp các chương trình mà các nhà nghiên cứu an ninh mạng có thể đăng ký để được kiểm duyệt và — nếu được chấp thuận — truy cập các mô hình với ít hạn chế an ninh mạng hơn: “Trusted Access for Cyber” của OpenAI và “Cyber Verification Program” của Anthropic.
Những rào chắn này đã bị chỉ trích rộng rãi, đặc biệt là bởi các nhà nghiên cứu có công việc là tìm ra các lỗ hổng chưa biết trong hệ thống và phát triển cách khai thác chúng trước khi tội phạm có thể làm. Trong một lần xuất hiện gần đây trên podcast về an ninh mạng, Mark Dowd, một nhà nghiên cứu bảo mật nổi tiếng, đã nói rằng: “Thật không thoải mái khi những công ty lớn ngẫu nhiên này đưa ra các quyết định tùy tiện về điều gì an toàn trong bảo mật và điều gì không.” Dowd đã dành nhiều thập kỷ để tìm kiếm và bán “zero-days” – các lỗ hổng phần mềm chưa được biết đến và các công cụ khai thác chúng – cho các chính phủ phương Tây, thay vì báo cáo cho các nhà sản xuất phần mềm để chúng được vá. Các chính phủ trả giá cao cho các lỗ hổng chính vì chúng còn tồn tại, điều này hữu ích cho các hoạt động tình báo. Dowd thừa nhận công việc của ông có thể khiến ông có định kiến, nhưng ông không đơn độc.
Một số người làm việc trong lĩnh vực an ninh mạng tấn công – họ chủ động thăm dò hệ thống để tìm điểm yếu – đã mô tả cho TechCrunch cách họ sử dụng công cụ AI và đối phó với các rào chắn của chúng. Chris Anley, nhà khoa học trưởng tại tập đoàn tư vấn bảo mật khổng lồ NCC Group, cho biết việc yêu cầu một mô hình AI cố gắng khai thác một lỗi là một bước quan trọng để xác nhận đó là một lỗ hổng thực sự đáng để sửa chữa. Nhưng nếu một rào chắn khiến mô hình từ chối trả lời câu hỏi trực tiếp, rào chắn đó sẽ gây hại cho những người phòng thủ, ông nói.
“Đây là nơi mà toàn bộ phần tấn công so với phòng thủ và các rào chắn xuất hiện, bởi vì ‘sửa mã này’ như một prompt vừa là một cơ chế thiết yếu để phòng thủ vừa là một lộ trình để tìm ra các lỗ hổng nghiêm trọng trong cơ sở mã,” Anley nói. “Vì vậy, cùng lúc, cùng một công cụ vừa là công cụ tấn công vừa là công cụ phòng thủ, và hai thứ đó thực sự không thể tách rời.” Ông tiếp tục: “Nó giống như một cái búa. Bạn không thể xây nhà mà không có búa. Nó chắc chắn là một công cụ nhưng nó cũng là một vũ khí không thể giảm thiểu được.” Khi ông và các đồng nghiệp gặp phải rào cản như vậy, họ đôi khi phải quay lại sử dụng các mô hình AI mã nguồn mở không có bất kỳ rào chắn nào.
Paolo Stagno, giám đốc công nghệ tại CrowdFense, một công ty nổi tiếng chuyên phát triển, mua lại và bán các lỗ hổng chưa biết cho các cơ quan chính phủ, đồng ý với Dowd, nói rằng các công ty AI “về cơ bản đối xử với khách hàng như trẻ con cần được trông nom” với các chương trình kiểm duyệt và rào chắn của họ. Stagno cho biết ông và các đồng nghiệp có sử dụng các mô hình tiên tiến (frontier models) – nhưng chỉ để kỹ thuật đảo ngược (reverse engineering). Ông tránh sử dụng AI để giúp tìm lỗ hổng hoặc xây dựng công cụ khai thác, ông nói, vì việc đưa công việc đó vào một mô hình dựa trên đám mây có nguy cơ làm rò rỉ dữ liệu lỗ hổng nhạy cảm hoặc bị hấp thụ vào các lần huấn luyện trong tương lai. Đối với bước đó, ông nói, họ sử dụng các mô hình mã nguồn mở chạy cục bộ, vì chúng không yêu cầu chia sẻ dữ liệu bên ngoài mô hình.
Giuseppe Cali, một nhà nghiên cứu bảo mật chuyên tìm kiếm zero-days và phát triển các công cụ khai thác, cho biết các rào chắn không cản trở công việc của ông. Điều này là do ông không sử dụng AI cho công việc tấn công; thay vào đó, ông sử dụng nó cho kỹ thuật đảo ngược ban đầu, để hiểu mã ông đang phân tích và để xây dựng các công cụ hỗ trợ. Với mục đích đó, ông nói, các công cụ AI có thể tăng tốc quá trình và cho phép ông tập trung vào việc khám phá lỗ hổng. “Tôi vẫn muốn tự mình thực hiện việc phát hiện lỗi và vũ khí hóa lỗi, và điều đó sẽ không thay đổi nếu tất cả các rào chắn được dỡ bỏ vào ngày mai,” Cali nói. “Tôi ghen tị với những lỗi của mình, và tôi quá yêu trò chơi này để để các mô hình chơi thay tôi.”
Một nhà nghiên cứu tại một nhà sản xuất linh kiện điện thoại thông minh, người đã phát biểu với điều kiện giấu tên vì không được phép nói chuyện với báo chí, cho biết nhà tuyển dụng của ông không tham gia chương trình CVP của Anthropic và do đó, các công cụ của họ hầu như không hữu ích cho việc tìm lỗ hổng vì các rào chắn quá nghiêm ngặt. “Nếu nó nhận thấy chúng tôi đang làm bất cứ điều gì liên quan đến bảo mật, nó sẽ dừng lại và không thể sử dụng được,” người này nói.
Chris Thompson — giám đốc điều hành của công ty an ninh mạng RemoteThreat và người sáng lập Offensive AI Con, một sự kiện tập trung vào an ninh tấn công và AI — cho biết theo kinh nghiệm của ông khi sử dụng các mô hình AI tiên tiến, các rào chắn có thể không nhất quán và hoạt động khác nhau mỗi ngày. Điều này đúng ngay cả trong các giới hạn lỏng lẻo hơn của các chương trình được kiểm duyệt của Anthropic và OpenAI. “Tôi nghĩ tác động thực tế là bạn dành rất nhiều thời gian để đàm phán với mô hình thay vì tập trung vào chương trình bảo mật cốt lõi,” Thompson nói. “Thay vì phân tích một lỗ hổng và suy luận về khả năng khai thác, bạn đang cố gắng tìm hiểu lý do tại sao bạn nhận được kết quả không nhất quán hoặc tại sao các mô hình lại ‘làm sạch’ quá mức đầu ra.”
Hậu quả là, các nhà nghiên cứu phải dựa vào hoặc bị đẩy về phía các mô hình mã nguồn mở của Trung Quốc như GLM – các mô hình có thể tải xuống miễn phí và chạy cục bộ mà không cần kiểm duyệt hoặc hạn chế sử dụng – Thompson cho biết. “Bạn có những nhà nghiên cứu có trách nhiệm này đang bị đẩy ra xa khỏi các hệ thống do Hoa Kỳ quản lý sang các hệ thống thuộc sở hữu nước ngoài,” ông nói. “Tôi nghĩ việc có những rào chắn này gây hại nhiều hơn là có lợi.”
Thay vì thắt chặt hơn nữa các hạn chế, Thompson kêu gọi các phòng thí nghiệm AI tiên tiến mở rộng các chương trình của họ, cung cấp quyền truy cập có trách nhiệm, và cũng buộc những người lạm dụng công cụ của họ phải chịu trách nhiệm. Nếu không, ông lập luận, những người phòng thủ sẽ thua trong cuộc đua AI. “Một cơn bão lớn đang đến. Có một làn sóng tấn công lớn sẽ xảy ra với tốc độ và quy mô chưa từng có,” Thompson nói. “Nhưng các công ty tư vấn bảo mật và các nhà nghiên cứu hợp pháp đang cố gắng tạo ra sự khác biệt lại đang bị kìm hãm ngay bây giờ.”
Nguồn tham khảo: TechCrunch
