미국 AI 모델 개발사들이 속도 조절을 주장할 수 있는 배경

Global Insights
26.09.16.
읽는시간 1분

퀵하게 보기

  • 새로운 평가 방식으로 보면, 크게 좁혀지지 않은 미국-중국의 AI 모델 격차
■ 새로운 평가 방식으로 보면, 크게 좁혀지지 않은 미국-중국의 AI 모델 격차

평가 방식의 변화를 통해 보는 AI 모델 개발의 방향.
Artificial Analysis는 9월 5일과 7일에 연달아 AI 지능 지수 (Artificial Analysis Intelligence Index)의 벤치마크 계산 방식을 변경.
7일에 발표한 버전 4.3 (v4.3)은 프론티어 AI 모델의 성능 개선이 빠르게 진행되면서 버전 5 (v5)의 변경분 일부를 앞당겨 적용한 것.
최근 AI 모델 평가 방식 변경은 평가의 기준이 어떤 방향을 향하고 있는지를 보여줌.
기존에는 얼마나 문제를 잘 푸는지를 중요하게 평가했다면, 이제는 실제 업무를 얼마나 안정적으로 싸고 빠르게 마무리하는지를 중요하게 여기는 방향으로 변화.
올해 초에 벤치마크 계산 방식을 변경하면서 지식을 묻는 벤치마크인 GPQA Diamond를 제외했는데, 최근 변경 (v4.2)에서는 AA-Briefcase를 추가.
이전에는 수능처럼 지식을 물어보는 평가를 했다면, 이제는 업무를 수행할 수 있는지를 확인하는 방향으로 전환.
최근에는 벤치마크를 측정하는 문제에서 비공개 문제의 비중을 높이고 있음.
공개된 문제에 최적화된 모델들이 높은 벤치마크 점수를 받지만 실제 활용할 때는 기대에 미치지 못하는 문제를 해결하기 위한 것.
비공개 문제의 비중은 이번에 45%까지 높아짐

작게

보통

크게

0

금융용어사전

KB금융그룹의 로고와 KB Think 글자가 함께 기재되어 있습니다. KB Think

금융용어사전

KB금융그룹의 로고입니다. KB라고 기재되어 있습니다 KB Think

이미지