Anthropic cho biết Claude đã được sử dụng cho nghiên cứu có thể liên quan đến vũ khí sinh học
TREE NEWS đưa tin: Anthropic đã tiết lộ rằng họ phát hiện và chặn các nỗ lực sử dụng mô hình Claude của mình cho nghiên cứu có thể liên quan đến phát triển vũ khí sinh học. Chi tiết đáng lo ngại hơn: các đối tượng đứng sau hoạt động này đã chuyển sang một mô hình AI đối thủ trong vòng vài ngày, cho thấy kẻ xấu có thể lách qua rào chắn của bất kỳ nhà cung cấp nào nhanh đến mức nào.
Chuyện gì đã xảy ra
Theo tiết lộ của công ty, các hệ thống an toàn của Claude đã gắn cờ và từ chối các truy vấn liên quan đến nghiên cứu sinh học có khả năng nguy hiểm. Thay vì từ bỏ nỗ lực, người dùng chỉ đơn giản chuyển sang một mô hình cạnh tranh — một minh chứng rõ ràng rằng các biện pháp kiểm soát an toàn tại một phòng thí nghiệm có rất ít ý nghĩa khi năng lực tương đương có sẵn ở nơi khác.
Tại sao điều này quan trọng với ngành crypto và AI
Sự việc này chạm đến cốt lõi của một cuộc tranh luận đang lớn dần trong cả ngành AI lẫn crypto: liệu an toàn và căn chỉnh có thể được thực thi ở tầng mô hình, hay phải được thực thi ở tầng hạ tầng.
- Rào chắn ở tầng mô hình có lỗ hổng. Nếu người dùng bị chặn có thể đổi nhà cung cấp trong vài ngày, huấn luyện từ chối chỉ là gờ giảm tốc, không phải bức tường.
- Tính toán phi tập trung làm tăng mức cược. Các mạng GPU và thị trường suy luận không cần cấp phép được thanh toán on-chain có thể khiến việc giám sát và chặn các truy vấn nguy hiểm trở nên khó khăn hơn ngay từ đầu.
- Khả năng xác minh trở thành sản phẩm. Các dự án làm về nguồn gốc mô hình, chứng thực suy luận và dấu vết kiểm toán on-chain bỗng có một trường hợp sử dụng cụ thể: chứng minh mô hình đã được hỏi gì và đã trả lời gì.
Tín hiệu rộng hơn của ngành
Với lĩnh vực crypto-AI, đây là một câu chuyện con dao hai lưỡi. Một mặt, nó xác nhận luận điểm rằng các phòng thí nghiệm AI tập trung không thể là người bảo vệ duy nhất cho an toàn — các giải pháp phi tập trung hứa hẹn tính minh bạch và khả năng chống kiểm duyệt. Mặt khác, nó phơi bày một sự thật khó chịu: chính những đặc tính không cần cấp phép khiến suy luận phi tập trung trở nên hấp dẫn cũng biến nó thành một vector tiềm năng cho việc lạm dụng.
Dự kiến các nhà quản lý sẽ để ý. Sàng lọc rủi ro sinh học là một trong số ít lĩnh vực mà các nhà hoạch định chính sách thuộc mọi phổ chính trị đồng thuận về kiểm soát chặt chẽ, và một sự cố liên quan đến các mô hình tiên phong có khả năng sẽ thúc đẩy các yêu cầu về báo cáo bắt buộc, tiêu chuẩn red-teaming, và có thể là chế độ cấp phép cho các hệ thống có năng lực cao.
Nhìn về phía trước
Bài kiểm tra thực sự là liệu ngành có thể xây dựng các cơ chế an toàn tồn tại qua việc chuyển đổi mô hình hay không — tình báo mối đe dọa chia sẻ, tiêu chuẩn từ chối xuyên nhà cung cấp, và chứng thực mật mã cho suy luận. Nếu an toàn vẫn là một tính năng của từng nhà cung cấp thay vì một thuộc tính của toàn hệ sinh thái, tiêu đề tiếp theo sẽ không phải về một truy vấn bị chặn. Nó sẽ là về một truy vấn đã thành công.




