지금 접수중인 스마트공장 지원사업 23건국산 솔루션 9 · 국내 기업 20
AI·데이터 분석

구글딥마인드 "AI 벤치마크, 10~20개 언어로만 모델 평가…범위 넓혀야"

ZDNet Korea2026-10-06

요약

구글딥마인드 로라 아로요 수석 과학자는 서울 AI 페스타 기조연설에서 현재 AI 벤치마크가 10~20개 언어로만 모델을 평가하고 있어 실제 역량 검증에 한계가 있다고 지적했다. 그는 영어로 작성한 문항을 번역하는 방식은 현지 문화적 맥락을 충분히 반영하지 못한다며, 현지 전문가와 함께 지역 언어·문화·관습을 반영한 평가 체계로 개편해야 한다고 주장했다. 또한 텍스트뿐 아니라 이미지 이해, 챗봇을 넘어 AI 에이전트와 피지컬 AI까지 평가 범위를 넓혀야 한다고 덧붙였다.

큐레이터 노트

원문에 없는 맥락입니다

그는 언어적 유창함과 문화 이해 능력을 같은 것으로 봐서는 안 된다며, 모델 응답의 안전성과 문화적 적절성을 구분해 측정해야 한다고 제안했다.

관련 항목

도입 효과·생산성 수치는 원문에 적힌 주장을 그대로 옮겼습니다. 스마트팩토리 기사는 공급사 보도자료가 많으므로 검증된 성과와 구분해 읽으세요.

이 글은 원문을 요약한 큐레이션입니다.

ZDNet Korea 원문 전체 보기 →

같은 분야의 다른 소식