실시간 뉴스



독파모 글로벌 AI 벤치마크 평가 '이변'...후발 주자 모티프 선두(종합)


후발주자 모티프 47점 '선두'…업스테이지 37점·SKT35점·LG 31점
AAII 배점 100점 중 25점…전문가·사용자 평가가 최종 변수

[아이뉴스24 서효빈 기자] 국내 'AI 국가대표'를 선발하는 독자 AI 파운데이션 모델(독파모) 프로젝트 2차 평가에서 모티프테크놀로지스가 글로벌 인공지능(AI) 성능 평가에서 가장 높은 점수를 기록했다. 다만 벤치마크 성능은 전체 평가의 일부인 만큼 이 점수만으로 각 모델의 실제 경쟁력이나 최종 순위를 판단하기는 어렵다는 의견도 있다.

후발주자 모티프 47점 '선두'…1차 1위 LG는 31점

글로벌 AI 모델 평가기관 아티피셜 애널리시스가 공개한 ‘아티피셜 애널리시스 인텔리전스 지수(AAII) [사진=아티피셜 애널리시스]
글로벌 AI 모델 평가기관 아티피셜 애널리시스가 공개한 ‘아티피셜 애널리시스 인텔리전스 지수(AAII) [사진=아티피셜 애널리시스]

13일 글로벌 AI 모델 평가기관 아티피셜 애널리시스(Artificial Analysis)에 따르면 최신 '아티피셜 애널리시스 인텔리전스 인덱스(AAII) v4.1.1'에서 모티프테크놀로지스의 '모티프3'는 47점을 기록했다. 이어 업스테이지의 '솔라 오픈2'가 37점, SK텔레콤의 'A.X-K2'가 35점, LG AI연구원의 'K-엑사원 2.0'이 31점을 받았다.

이 결과는 독파모 1차 평가와 다른 판도를 보였다는 점에서 주목된다. 앞선 1차 평가에서 LG AI연구원은 벤치마크 평가 40점 만점에 33.6점으로 가장 높은 점수를 기록했지만 이번 AAII에서는 4개 모델 가운데 가장 낮은 점수를 받았다.

반면 가장 늦게 독파모 경쟁에 합류한 모티프테크놀로지스는 AAII에서 가장 높은 점수를 기록했다. 업스테이지 역시 두 번째로 높은 점수를 기록하면서 글로벌 벤치마크에서는 두 스타트업이 대기업을 앞섰다.

AAII는 지식과 추론, 코딩 등 여러 영역의 개별 벤치마크를 하나의 점수로 종합하는 방식이다. 최신 AAII v4.1.1은 'GDPval-AA v2'(실제 직업·업무 수행 능력), 'τ³-Banking'(은행 업무에서의 도구 활용 능력), 'Terminal-Bench v2.1'(코딩·터미널 활용 능력), 'SciCode'(과학 분야 코딩 능력), 'Humanity's Last Exam'(고난도 추론·지식), 'GPQA Diamond'(고난도 과학 추론), 'CritPt'(물리학 추론), 'AA-Omniscience'(지식 정확도·환각 여부), 'AA-LCR'(장문맥 이해·추론) 등 9개 평가를 반영한다.

앞서 과학기술정보통신부는 독파모 2차 평가를 위해 아티피셜 애널리시스에 국내 모델 성능 평가를 의뢰했다. 과기정통부는 AAII에서 받은 점수를 독파모 평가 배점에 맞춰 환산할 예정이다

AAII 배점 25점…전문가·사용자 평가가 최종 변수

글로벌 AI 모델 평가기관 아티피셜 애널리시스가 공개한 ‘아티피셜 애널리시스 인텔리전스 지수(AAII) [사진=아티피셜 애널리시스]
배경훈 부총리 겸 과학기술정보통신부 장관이 서울 강남구 코엑스에서 열린 독자 AI 파운데이션 모델 프로젝트 1차 발표회에서 환영사하고 있다. [사진=연합뉴스]

다만 AAII 순위가 독파모 2차 평가의 최종 순위로 그대로 이어지는 것은 아니다. 2차 평가는 벤치마크 평가 40점, 전문가 평가 35점, 사용자 평가 25점으로 구성된다. 벤치마크 평가 40점 가운데 AAII가 25점, 한국지능정보사회진흥원(NIA)의 자체 벤치마크가 15점을 차지한다.

AI 업계에서는 AAII 점수가 모델의 모든 성능을 대변하는 것은 아니라는 평가도 나온다. AI 업계 관계자는 "벤치마크 점수는 분명 중요한 지표지만 특정 평가에 최적화할 경우 실제 사용 환경이나 다른 영역의 성능과 차이가 날 수 있다"고 말했다.

과기정통부도 벤치마크 결과뿐 아니라 NIA 벤치마크와 전문가·사용자 평가 등을 종합적으로 살펴본다는 입장이다. 과기정통부 관계자는 "단순히 성능이 높은 모델인지, 특정 평가에 과도하게 최적화된 모델인지까지 종합적으로 살펴보고 있다"며 "최종 평가는 벤치마크뿐 아니라 전문가·사용자 평가 등을 함께 봐야 한다"고 말했다.

과기정통부는 전체 평가를 종합해 다음주 중 2차 단계 결과를 발표할 예정이다. 이번 평가에서는 LG AI연구원과 SK텔레콤, 업스테이지, 모티프테크놀로지스 등 4개 팀 가운데 1개 팀이 탈락한다.

/서효빈 기자(x40805@inews24.com)




주요뉴스



alert

댓글 쓰기 제목 독파모 글로벌 AI 벤치마크 평가 '이변'...후발 주자 모티프 선두(종합)

댓글-

첫 번째 댓글을 작성해 보세요.

로딩중

뉴스톡톡 인기 댓글을 확인해보세요.



포토뉴스