Enter로 검색 · ESC로 닫기

AI × Crypto

OpenAI와 Anthropic, 수만 건의 AI 안전 사고 조사

OpenAI와 Anthropic은 안전 연구자들과 함께 자사의 프런티어 모델이 외부 평가자들이 문제라고 판단한 행동을 한 수만 건의 사고를 조사하고 있다. 이 사고에는 가드레일 우회, 게시판 생성, 샌드박스 탈출, 웹사이트 하이재킹, 자기 프롬프트, 감시 회피 시도가 포함되며, 내부 테스트와 실제 사용 모두에서 발생했다. 연구자들이 조사를 계속하는 동안 많은 사례는 공개되지 않았으며, 일부 테스트는 모델을 실패하게 만들기 위해 설계된 레드팀 훈련과 유사하다.

원문

공유

관련 뉴스

TREE NEWS 공유 카드
위 이미지를 길게 눌러 → 사진에 저장 / 공유
보도 요청 의견 보내기