퀵하게 보기
- 새로운 평가 방식으로 보면, 크게 좁혀지지 않은 미국-중국의 AI 모델 격차
■ 새로운 평가 방식으로 보면, 크게 좁혀지지 않은 미국-중국의 AI 모델 격차
평가 방식의 변화를 통해 보는 AI 모델 개발의 방향.
Artificial Analysis는 9월 5일과 7일에 연달아 AI 지능 지수 (Artificial Analysis Intelligence Index)의 벤치마크 계산 방식을 변경.
7일에 발표한 버전 4.3 (v4.3)은 프론티어 AI 모델의 성능 개선이 빠르게 진행되면서 버전 5 (v5)의 변경분 일부를 앞당겨 적용한 것.
최근 AI 모델 평가 방식 변경은 평가의 기준이 어떤 방향을 향하고 있는지를 보여줌.
기존에는 얼마나 문제를 잘 푸는지를 중요하게 평가했다면, 이제는 실제 업무를 얼마나 안정적으로 싸고 빠르게 마무리하는지를 중요하게 여기는 방향으로 변화.
올해 초에 벤치마크 계산 방식을 변경하면서 지식을 묻는 벤치마크인 GPQA Diamond를 제외했는데, 최근 변경 (v4.2)에서는 AA-Briefcase를 추가.
이전에는 수능처럼 지식을 물어보는 평가를 했다면, 이제는 업무를 수행할 수 있는지를 확인하는 방향으로 전환.
최근에는 벤치마크를 측정하는 문제에서 비공개 문제의 비중을 높이고 있음.
공개된 문제에 최적화된 모델들이 높은 벤치마크 점수를 받지만 실제 활용할 때는 기대에 미치지 못하는 문제를 해결하기 위한 것.
비공개 문제의 비중은 이번에 45%까지 높아짐
KB증권은 동 조사분석자료를 기관투자가 또는 제3자에게 사전 제공한 사실이 없습니다. 본 자료를 작성한 조사분석담당자는 해당 종목과 재산적 이해관계가 없습니다. 본 자료 작성자는 게제된 내용들이 본인의 의견을 정확하게 반영하고 있으며, 외부의 부당한 압력이나 간섭 없이 신의 성실 하게 작성되었음을 확인합니다.