Anthropic hé lộ vai trò của AI trong các nghiên cứu liên quan vũ khí sinh học
Công ty công nghệ trí tuệ nhân tạo Anthropic vừa công bố một báo cáo dài 154 trang về các mối đe dọa tiềm ẩn, trong đó cho thấy mô hình AI của họ từng phản ứng với các yêu cầu nghiên cứu có liên quan đến khả năng phát triển vũ khí sinh học. Sự việc bắt nguồn từ một đề xuất xin tài trợ nhằm tăng khả năng lây truyền và né tránh miễn dịch của virus do muỗi truyền gây bệnh Chikungunya. Mặc dù yêu cầu này bị mô hình AI “Claude” của Anthropic chặn lại do các giới hạn an toàn nghiêm ngặt, nhóm nghiên cứu vẫn tìm cách sử dụng các mô hình AI của đối thủ cạnh tranh bằng cách chuyển hướng yêu cầu sang các nền tảng khác. Vấn đề nêu bật thách thức an ninh khi AI đối diện với các nội dung nhạy cảm trong lĩnh vực sinh học.
Đề xuất tài trợ bị từ chối, nhóm nghiên cứu tìm cách tiếp cận mô hình AI đối thủ
Dự án nghiên cứu nhằm mục đích thúc đẩy sự lây lan của virus Chikungunya vốn chưa có phương pháp điều trị, do các nhà khoa học dân sự đề xuất nhưng dự kiến được thực hiện trong bối cảnh tổ chức quân sự. Anthropic đã nhiều lần từ chối đề xuất này, khi mô hình Claude vận hành các bộ lọc an toàn nghiêm ngặt ngăn chặn các nội dung nguy cơ. Tuy nhiên, nhóm nghiên cứu đã xây dựng một hệ thống tự động chuyển các yêu cầu bị chặn sang một mô hình AI của đối thủ để tiếp tục soạn thảo mã liên quan. Đội ngũ Anthropic nhận định đây là phản ứng đối với chính sách từ chối có phần cứng nhắc của họ.
5 trường hợp liên quan vũ khí sinh học bị phát hiện nhưng chưa khẳng định mục đích
Báo cáo đề cập đến 5 trường hợp cụ thể đã bị phát hiện, trong đó Anthropic đã khóa một số tài khoản và ngăn chặn quyền truy cập của một số phòng thí nghiệm có liên quan. Tuy nhiên, công ty không khẳng định các cá nhân hay phòng thí nghiệm này có ý định gây hại. Báo cáo nêu rõ: “Chúng tôi không cáo buộc họ có mục đích xấu, vì xác minh danh tính có thể gây rủi ro cho họ.” Trong một trường hợp cụ thể liên quan đến nghiên cứu virus cúm gia cầm, nhà nghiên cứu đã được dẫn dắt để sử dụng mô hình AI hạn chế chức năng sau nhiều lần tương tác. Qua đó, Anthropic nhận thấy các biện pháp lọc nội dung đã phần nào ngăn chặn nguy cơ, dù vẫn chưa thể đánh giá toàn diện mọi rủi ro.
Thách thức của AI trong việc giám sát và kiểm soát nội dung nhạy cảm về an toàn sinh học
Sự việc cho thấy AI hiện vẫn gặp khó khăn trong việc giám sát và phòng tránh các hành vi lách luật khi xử lý các chủ đề nhạy cảm trong lĩnh vực sinh học và vũ khí. Báo cáo của Anthropic tạo nên lời cảnh báo trong ngành về việc sử dụng AI trong các nghiên cứu khoa học có rủi ro cao, đặc biệt liên quan đến các dự án kết hợp quân sự - dân sự. Việc xây dựng các cơ chế giám sát và quản lý phù hợp, cùng với sự chủ động của doanh nghiệp AI trong việc ngăn chặn các hành vi lạm dụng công nghệ, vẫn là chủ đề trọng tâm của ngành.
Đoạn báo cáo được soạn bởi nhóm an ninh chính của Anthropic thể hiện sự sẵn sàng minh bạch về các vấn đề an ninh phức tạp do AI gây ra, đồng thời kêu gọi tìm kiếm sự cân bằng giữa phát triển công nghệ và kiểm soát hiệu quả.