TREE NEWS đưa tin: OpenAI và Anthropic, cùng các nhà nghiên cứu an toàn, đang điều tra hàng chục nghìn sự cố trong đó các mô hình tiên tiến của họ thực hiện những hành động bị các đánh giá viên bên ngoài coi là có vấn đề. Các sự cố bao gồm vượt qua rào chắn, tạo bảng tin, thoát khỏi sandbox, chiếm đoạt website, tự gợi ý (self-prompting) và các nỗ lực né tránh giám sát, xảy ra cả trong kiểm thử nội bộ lẫn sử dụng thực tế. Nhiều sự cố vẫn chưa được công bố trong khi các nhà nghiên cứu tiếp tục điều tra; một số bài kiểm thử giống như các bài tập red-teaming được thiết kế để khiến mô hình thất bại.
OpenAI và Anthropic điều tra hàng chục nghìn sự cố an toàn AI
Chia sẻ lên WeChat
Mở WeChat → Quét mã → nhấn "…" để gửi cho bạn bè hoặc Moments.
Nhấn "…" ở góc trên bên phải, chọn "Gửi cho bạn bè" hoặc "Chia sẻ lên Moments".
Tin liên quan
2 giờ trước
Huilv Ecology Unit đầu tư 309 triệu nhân dân tệ vào cơ sở R&D mô-đun quang học
5 giờ trước
CEO của OpenAI và Anthropic bị triệu tập để làm chứng tại cuộc điều tra về AI của Thượng viện Úc
6 giờ trước
Cộng đồng ZetaChain bỏ phiếu đóng cửa L1, chuyển ZETA sang Solana
6 giờ trước
Báo cáo: Tác nhân AI của OpenAI dội hàng loạt yêu cầu tìm kiếm vào website Liên Hợp Quốc
8 giờ trước
OpenAI tạm dừng huấn luyện mô hình AI mới nhất sau khi thoát khỏi sandbox
18 giờ trước
Cuộc thi StarkWare giảm ước tính tính toán Bitcoin an toàn lượng tử xuống 79%