0

오픈AI, 안전성 우려에 차기 AI 모델 출시 계획 철회

26.09.29.
읽는시간 0분

[연합뉴스 사진 제공]

(서울=연합인포맥스) 박지은 기자 = 오픈AI가 차기 인공지능(AI) 모델인 'GPT-6.1 아스트라(Astra)'를 출시하지 않기로 결정했다.

28일(현지시간) 월스트리트저널에 따르면 오픈AI의 사치 자인 안전 시스템 책임자는 GPT-6.1 아스트라가 두 가지 측면에서 성능 저하를 보였다며 자사의 안전 기준을 충분히 충족하지 못했다고 밝혔다.

차기 모델은 이전 모델인 'GPT-6 아스트라'와 비교해 AI가 인간의 의도나 지시를 얼마나 충실히 따르는지를 측정하는 '정렬(alignment)' 테스트에서 저조한 성적을 보였다. 해당 모델은 특히 자신이 수행했거나 수행하지 않은 작업에 대해 사용자에게 항상 솔직하게 알리지 않는 등 높은 수준의 기만적 성향을 드러냈다.

두 번째 문제는 '범위 권한(scope authorization)' 사안이다. 새 모델은 사용자에게 허락을 구하지 않고 작업을 강행하거나 안전하지 않을 수 있는 상황에서도 외부 도구 및 서비스를 임의로 사용하려 시도하는 등의 행동을 보였다.

자인 책임자는 "안전과 정렬 문제에 있어서는 항상 상충 관계(trade-off)가 존재한다"며 "주어진 범위 내에서 작동하면서도, 모델이 난관에 부딪혔을 때 작업을 수행하는 방식에서 '게으름'을 피우지 않도록 하는 적절한 균형점을 찾아야 한다"고 말했다.

그는 새 모델이 게으름과 같은 문제에서는 개선됐지만 오픈AI가 설정한 안전 및 정렬 기준을 완전히 충족하지는 못해 결국 공개 출시하지 않기로 결정했다고 전했다.

자인 책임자는 성명을 통해 "우리는 사내 개발 단계에서든 사용자에게 모델을 배포하는 단계에서든 안전을 확보하고자 한다"며 "사용자에게 모델을 배포할 때는 안전성과 정렬 측면에서 매우 엄격한 기준을 적용한다"라고도 강조했다.

앞서 오픈AI는 이달 초 GPT-6 아스트라를 공개한 바 있다. 지난주에는 GPT-6 제품군에 'GPT-6 솔(Sol)'과 'GPT-6 루나(Luna)'라는 두 가지 추가 등급 모델도 선보였다.

이후 오픈AI는 GPT-6.1 아스트라를 오는 10월경 출시할 계획이었으나 샌프란시스코에서 열리는 오픈AI의 연례 개발자 컨퍼런스를 하루 앞두고 해당 계획 철회 결정을 내렸다.

오픈AI는 새 모델 출시를 철회하는 대신 동일한 기반 모델을 활용해 추가적인 강화 학습을 수행하고 향후 GPT-6 모델을 개발하는 데는 이를 사용할 계획이다.

자인 책임자는 오픈AI가 GPT-6.1 아스트라에서 확인된 문제의 근본 원인을 파악하기 위해 몇 가지 심층 분석을 수행할 예정이라며 모델 개발의 모든 단계를 조사할 것이라고 설명했다.

이번 철회 발표는 첨단 AI 모델의 안전성에 대한 우려가 업계 전반에서 고조되는 가운데 이뤄졌다. 최근 몇 주간 오픈AI와 앤트로픽은 자사의 내부 AI 개발 속도를 조절하겠다고 밝히며, 업계 파트너들에게도 최첨단 AI 모델 개발 속도를 늦추고 안전 표준에 투자할 것을 촉구했다.

https://naver.me/FKGvsZPM

jepark2@yna.co.kr

박지은

금융용어사전

KB금융그룹의 로고와 KB Think 글자가 함께 기재되어 있습니다. KB Think

금융용어사전

KB금융그룹의 로고입니다. KB라고 기재되어 있습니다 KB Think

이미지