(서울=연합인포맥스) 이재헌 기자 = 중국 인공지능(AI) 스타트업 문샷AI의 대형언어모델(LLM) '키미(Kimi)'가 안전 가이드라인을 무력화하는 해킹 기법에 뚫려 생물무기 제조법과 암살 실행 방안 등 위험 정보를 제공한 것으로 나타났다.
30일(현지시간) BBC에 따르면 영국의 AI 사이버 보안 전문 기업 마인드가드는 '키미 K2.6' 및 '키미 K3 스웜' 모델을 대상으로 우회 지시어를 입력해 가이드라인을 무력화하는 탈옥(Jailbreak)에 성공했다. 마인드가드는 지난 7월 이 같은 보안 결함을 확인한 뒤 9월 12일 자체 블로그에 관련 내용을 공개했지만, 문샷AI는 언론 취재가 시작된 최근에야 마인드가드와 관련 논의를 개시한 것으로 전해졌다.
특히 키미는 안전장치 우회 직후 생물무기 제조나 암살 방안에 대한 질의에 응답했을 뿐만 아니라, 요청하지 않은 다른 위험 주제까지 능동적으로 탐색하며 창의적인 권장 사항을 덧붙였다고 마인드가드는 밝혔다.
피터 가라간 마인드가드 설립자는 "일단 탈옥이 작동하면 어떤 주제든 제약 없이 이야기하게 되며, 다른 악의적인 주제에 대해서도 창의적이고 자발적으로 권장 사항을 제시한다"고 지적했다.
마인드가드는 키미가 제시한 위험 정보가 실제 실행 가능한지까지는 입증하지 못했지만, 안전장치 자체가 무력화된 점이 핵심 문제라고 짚었다. 탈옥된 키미 2.6 모델을 활용하면 해커가 연산 자원에서 코드를 직접 실행하고 외부 인터넷에 연결할 수 있어 향후 대규모 사이버 공격을 감행하는 교두보로 악용될 위험이 크다고 진단했다.
문샷AI는 자체 평가에서는 이러한 종류의 요청에 대한 거절률이 높게 나타났다고 해명했다. 또 안전한 AI 구축을 위해 제3자 제보를 환영하며 내부 검토를 진행 중이라고 설명했다.
[출처: 연합뉴스 자료사진]
jhlee2@yna.co.kr
이재헌
jhlee2@yna.co.kr
금융용어사전
금융용어사전