AI 핵심 요약
beta- 구글 딥마인드 로라 아로요가 6일 AI Festa 2026에서 AI의 문화 이해 한계를 지적했다.
- AI는 수십 개 언어를 구사해도 문화·사회규범 이해는 부족했고 한국 맥락 오류가 컸다.
- 향후 평가는 언어·방언·지역 규범까지 반영한 문화 우선 기준이 필요하다고 했다.
!AI가 자동 생성한 요약으로 정확하지 않을 수 있어요.
"AI에 서구 중심 기본값"…존댓말·사회규범 반영 한계
[서울=뉴스핌] 심재민 인턴기자 = 생성형 인공지능(AI)이 수십 개 언어를 자연스럽게 구사하는 수준까지 발전했지만, 각 언어권의 문화와 사회 규범을 제대로 이해하는 능력은 여전히 부족하다는 지적이 나왔다. 특히 한국 문화 맥락을 담은 질문에서는 다른 아시아 국가보다 높은 문화적 적절성 오류가 관찰된 것으로 나타났다.
로라 아로요 구글 딥마인드 리서치 사이언티스트는 6일 AI Festa 2026에서 '보편적 합의를 넘어: 글로벌 AI 정렬을 위한 문화 우선 기반 마련(Beyond Universal Consensus: Culture First Grounding for Global AI Alignment)'을 주제로 기조연설을 하고 이같이 밝혔다.

아로요 사이언티스트는 "요즘 대부분의 AI 모델은 약 70~100개 언어를 구사하지만 현재 대부분의 벤치마크는 10~20개 언어만 평가한다"며 "지구상에 존재하는 약 7000개 언어 가운데 극히 일부에 불과하다"고 말했다.
문제는 평가 방식 역시 영어에 크게 의존한다는 점이다. 현재 다국어 AI 벤치마크 상당수는 영어로 만들어진 질문을 다른 언어로 번역하는 방식으로 구성돼 있다.
영어 문장을 다른 언어로 옮길 경우 텍스트의 기본적인 상황은 유지되더라도 지리적·문화적 맥락까지 전달되지 않는 경우가 발생한다는 설명이다. 실제 현재 AI 벤치마크 가운데 문화적 인식 수준을 평가하는 경우는 20% 미만이라고 아로요 사이언티스트는 밝혔다.
그는 이를 '문화적 사각지대'라고 규정했다. AI가 기존 안전 정책상 문제가 없는 답을 내놓더라도 해당 지역의 예절이나 종교적 가치, 사회 규범을 위반하는 문화적으로 부적절한 답변이 될 수 있다는 것이다.
언어가 바뀔 때 AI의 문화 이해 성능이 급격히 떨어지는 현상도 나타났다.
싱가포르 문화와 관련한 동일한 질문을 AI에 입력한 결과 영어로 질문했을 때는 약 60%가 적절한 답변을 냈지만 말레이어에서는 약 50%, 타밀어에서는 약 40%로 떨어졌다. 영어와 말레이어, 타밀어가 모두 싱가포르의 공용어임에도 언어에 따라 성능 격차가 나타난 것이다.
한국의 경우 문제는 더욱 두드러졌다. 연구진이 수집한 한국 문화 맥락 프롬프트는 싱가포르와 인도, 대만, 방글라데시, 파키스탄 등 비교 대상 국가 가운데 가장 높은 문화적 적절성 오류율을 기록했다.
아로요 사이언티스트는 이 같은 오류의 원인 가운데 하나로 AI의 '서구 중심 기본값'을 꼽았다. 모델이 이용자의 입력을 충분히 처리하지 못하면 서구 중심 기본값에 의존하면서 현지 문화와 충돌할 수 있다는 것이다.
그는 한국의 존댓말 체계를 대표적인 사례로 들며 "문화적 사각지대는 한국어의 존대 체계를 따르지 않는 것처럼 단순한 형태로 나타날 수도 있다"고 설명했다.
아로요 사이언티스트는 향후 AI 평가 과정에서 언어와 지역별 전통·사회규범·법률뿐 아니라 관용적 표현과 방언 등 세부적인 언어 특성까지 반영해야 한다고 강조했다.
그는 "수학을 제외하면 현실 세계에는 하나의 진실만 존재하지 않는다"며 "실제 세계는 모호성과 다양성으로 가득한 만큼 AI 시스템을 평가하는 방식에서도 이를 받아들여야 한다"고 말했다.
이어 "7000개 언어와 방언, 코드 스위칭까지 어떻게 포괄할 것인지, 특히 저자원 언어에서 번역을 반복하지 않고 의미를 보존할 수 있을지가 앞으로 해결해야 할 과제"라며 "서로 다른 문화권에서 AI를 평가자로 활용할 때 그 신뢰성을 어떻게 검증할 것인지도 살펴봐야 한다"고 덧붙였다.
flurry327@newspim.com












