0

김장겸 "독파모 사용자 평가단 67% 중복"…과기부 "평가 룰 사전 합의"

26.10.06.
읽는시간 0분

벤치마크 1위 모티프, 정성평가서 순위 하락…평가 공정성 공방

과기부 2차관 "배점·평가방식 참여기업과 사전 협의…외부서 AI 생태계 성과 평가"

(서울=연합인포맥스) 윤영숙 기자 = 정부의 독자 인공지능(AI) 파운데이션 모델 프로젝트 평가 과정에서 1·2차 AI 전문사용자 평가단의 상당수가 중복되고 정성평가가 당락에 큰 영향을 미쳤다는 지적이 국정감사에서 제기됐다.

과학기술정보통신부는 평가 기준과 배점, 방식 등을 참여 기업들과 사전에 협의해 확정했다며 평가 절차의 공정성에는 문제가 없다는 입장을 밝혔다.

김장겸 국민의힘 의원은 6일 국회 과학기술정보방송통신위원회 국정감사에서 "1차와 2차 AI 전문사용자 평가단 49명 가운데 동일인이 33명으로 67.3%에 달한다"며 "사실상 10명 중 7명이 같은 사람인데 제대로 된 평가가 가능하겠느냐"고 지적했다.

김 의원은 전문가 평가단은 1·2차 평가에서 중복되지 않도록 구성하면서 AI 전문사용자 평가단에는 같은 원칙을 적용하지 않은 점도 문제 삼았다.

그는 특히 평가 항목별 결과를 들어 정성평가가 최종 당락을 좌우할 수 있다고 주장했다.

배점 25점인 벤치마크 평가에서는 모티프가 11.9점으로 1위를 기록했지만, 배점이 가장 큰 35점짜리 전문가 평가에서는 LG AI연구원이 29.5점으로 1위를 차지했다. AI 전문사용자 평가에서는 SK텔레콤이 11.6점으로 1위, 일반사용자 평가에서는 LG AI연구원이 7.6점으로 1위를 기록했다.

모티프는 전문가 평가와 AI 전문사용자 평가, 일반사용자 평가에서는 각각 4위에 그쳤다.

김 의원은 "글로벌 벤치마크에서 가장 높은 평가를 받은 기업도 정성평가에 따라 결과가 크게 달라질 수 있다"며 "탈락 기업에는 모델 수준이 떨어진다는 낙인이 찍힐 수 있는 만큼 평가 방식이 공정해야 한다"고 말했다.

평가위원의 이해충돌 여부를 서약서 중심으로 확인한 점도 문제로 지적했다.

김 의원은 "국가대표 AI 모델을 선발하면서 이해관계 방지를 사실상 개인의 서약에 의존하는 것은 제도적 설계가 부실한 것"이라고 주장했다.

이에 류제명 과기정통부 2차관은 "평가 기준과 배점 등은 참여 기업들과 사전에 충분히 논의해 모두 인지한 상태에서 평가가 이뤄졌다"고 반박했다.

그는 "세부 배점 기준과 평가 방법, 블라인드 여부 등을 기업들과 개별적으로도 협의했고 전체 참여 기업이 모인 자리에서도 논의했다"며 "평가 전에 게임의 룰을 확정했고 두 차례에 걸쳐 세부사항을 안내했다"고 설명했다.

이어 "평가 내용에 대해서는 이견이 있을 수 있지만 게임의 룰 자체는 명확하게 공개된 상태에서 진행됐다"고 강조했다.

정부가 민간 AI 모델 개발에 직접 개입한다는 지적에 대해서는 GPU 등 컴퓨팅 자원이 부족하고 모델 개발의 불확실성이 컸던 상황에서 정부의 마중물 역할이 필요했다고 설명했다.

류 차관은 또 독자 AI 파운데이션 모델 사업 이후 해외 벤치마크 운영 기관으로부터 한국의 AI 생태계가 확대되고 경쟁력이 높아졌다는 평가와 인증서를 받았다며 "여러 논란과 앞으로 풀어야 할 과제가 있지만 이번 사업을 통해 국내 AI 생태계가 더 넓고 깊어졌다는 외부 평가도 있다"고 말했다.

국민의힘 김장겸 의원

[출처: 연합뉴스 자료사진]

ysyoon@yna.co.kr

윤영숙

윤영숙

금융용어사전

KB금융그룹의 로고와 KB Think 글자가 함께 기재되어 있습니다. KB Think

금융용어사전

KB금융그룹의 로고입니다. KB라고 기재되어 있습니다 KB Think

이미지