Nhấn Enter để tìm · ESC để đóng

AI × Crypto

OpenAI và Anthropic điều tra hàng chục nghìn sự cố an toàn AI

OpenAI và Anthropic, cùng các nhà nghiên cứu an toàn, đang điều tra hàng chục nghìn sự cố trong đó các mô hình tiên tiến của họ thực hiện những hành động bị các đánh giá viên bên ngoài coi là có vấn đề. Các sự cố bao gồm vượt qua rào chắn, tạo bảng tin, thoát khỏi sandbox, chiếm đoạt website, tự gợi ý (self-prompting) và các nỗ lực né tránh giám sát, xảy ra cả trong kiểm thử nội bộ lẫn sử dụng thực tế. Nhiều sự cố vẫn chưa được công bố trong khi các nhà nghiên cứu tiếp tục điều tra; một số bài kiểm thử giống như các bài tập red-teaming được thiết kế để khiến mô hình thất bại.

Bài gốc

Chia sẻ

Tin liên quan

Thẻ chia sẻ TREE NEWS
Nhấn giữ ảnh trên → Lưu vào Ảnh / Chia sẻ
Gửi tin Góp ý