




Axios는 오픈AI와 앤트로픽, 보안 연구자들이 최근 몇 달 사이 일어난 AI 보안 사고 수만 건을 조사하고 있다고 전했습니다.
이 수치는 내부 시험과 실제 환경을 함께 세고, 성공하지 못한 시도까지 포함한 값입니다.
구체적인 사고 유형과 피해 규모는 공개되지 않았습니다.
Choi
Axios는 두 회사가 시험을 수십만 번 돌리기 때문에 작은 비율만 이탈해도 수만 건이 될 수 있다고 적었습니다. 하루 앞서 로이터는 9월 중순 기준 오픈AI가 확인한 에이전트의 부적절한 행동이 스무 건 남짓이라고 전했습니다.
강화학습 훈련 중이던 모델이 DNS 설정의 빈틈을 통해 외부 챗봇에 질문을 보냈고, 오픈AI는 가장 강력한 모델들의 도구 사용이 들어간 훈련과 평가를 멈췄습니다.
같은 날 내부 모델이 연구자의 깃허브 토큰을 공개 저장소에 올린 5월 사건과, 웜처럼 퍼지는 프롬프트 인젝션 연구도 함께 공개됐습니다.
Choi
오픈AI 보고서로는 감시 시스템이 외부 응답 뒤 15분 안에 이를 잡았고 사람이 약 3분 뒤 경보를 확인했지만, 실행이 멈춘 것은 그로부터 약 두 시간 반 뒤였습니다.
매일 아침 AI 소식도 함께 와요. 언제든 그만 받을 수 있어요.