KPI뉴스 - 카카오 AI, 한국어 독해 능력 인간보다 앞서

  • 흐림정선군
  • 구름많음파주24.6℃
  • 맑음서귀포29.4℃
  • 맑음울산28.7℃
  • 맑음창원29.5℃
  • 구름많음인제23.6℃
  • 구름많음서울26.0℃
  • 구름많음추풍령23.6℃
  • 맑음고창군30.3℃
  • 구름많음동해26.4℃
  • 흐림백령도24.5℃
  • 맑음울릉도28.5℃
  • 구름많음임실27.8℃
  • 구름많음이천23.6℃
  • 맑음서산28.2℃
  • 맑음대구27.7℃
  • 맑음영광군29.3℃
  • 구름많음보령30.4℃
  • 구름많음순천27.1℃
  • 맑음거창26.0℃
  • 구름많음속초27.0℃
  • 구름많음철원25.0℃
  • 맑음고산28.2℃
  • 구름많음함양군26.9℃
  • 맑음홍성27.3℃
  • 맑음광양시29.8℃
  • 맑음제주32.1℃
  • 구름많음흑산도28.9℃
  • 맑음밀양28.6℃
  • 맑음부산31.7℃
  • 구름많음부여26.5℃
  • 구름많음장흥30.2℃
  • 구름많음강화25.6℃
  • 구름많음강진군31.2℃
  • 맑음남해27.5℃
  • 맑음울진30.5℃
  • 구름많음양평23.5℃
  • 흐림상주24.6℃
  • 맑음대전26.7℃
  • 구름많음의성25.5℃
  • 맑음청주26.6℃
  • 구름많음북춘천24.4℃
  • 맑음경주시28.4℃
  • 구름많음안동24.7℃
  • 맑음성산29.2℃
  • 구름많음서청주23.8℃
  • 맑음영천25.0℃
  • 구름많음통영29.8℃
  • 맑음인천26.7℃
  • 맑음강릉28.3℃
  • 구름많음구미25.8℃
  • 맑음거제29.3℃
  • 맑음장수26.6℃
  • 맑음정읍29.9℃
  • 맑음북부산30.4℃
  • 구름많음완도29.4℃
  • 맑음수원27.2℃
  • 구름많음영주25.0℃
  • 맑음부안29.1℃
  • 맑음북강릉27.9℃
  • 맑음봉화24.6℃
  • 구름많음금산24.1℃
  • 구름많음전주30.3℃
  • 구름많음해남29.0℃
  • 구름많음보은23.6℃
  • 맑음포항28.7℃
  • 구름많음세종25.7℃
  • 맑음목포29.9℃
  • 구름많음산청27.0℃
  • 구름많음진도군28.8℃
  • 구름많음충주25.1℃
  • 맑음영덕28.2℃
  • 구름많음문경26.0℃
  • 구름많음천안25.0℃
  • 맑음고창30.5℃
  • 구름많음제천23.3℃
  • 구름많음원주24.4℃
  • 맑음양산시30.3℃
  • 구름많음영월24.6℃
  • 맑음광주30.3℃
  • 구름많음대관령23.7℃
  • 맑음북창원29.3℃
  • 맑음여수28.6℃
  • 구름많음고흥29.3℃
  • 구름많음남원28.7℃
  • 맑음김해시30.0℃
  • 맑음의령군26.0℃
  • 맑음태백25.9℃
  • 구름많음홍천23.0℃
  • 구름많음합천25.3℃
  • 맑음진주26.9℃
  • 구름많음동두천25.7℃
  • 구름많음보성군30.3℃
  • 맑음군산29.7℃
  • 구름많음순창군28.7℃
  • 맑음청송군24.9℃
  • 구름많음춘천23.8℃

카카오 AI, 한국어 독해 능력 인간보다 앞서

김들풀 Google구글에서 선호하는 출처로 추가
기사승인 : 2019-01-31 19:44:53
LG CNS가 운영하는 기계 독해 능력 평가에서 1위 기록
카카오 자체 개발 AI 언어모델 한국어 학습 데이터 'KorQuAD'

카카오가 자체 개발한 AI 언어모델 한국어 학습 데이터 'KorQuAD(The Korean Question Answering Dataset)'가 LG CNS가 주최한 기계 독해 능력 평가에서 91.85점을 받으며 1위를 차지했다. 


LG CNS가 인간의 문장 판별 및 독해 능력 수준(Human Performance)이라고 밝힌 91.20점보다 0.65점 높은 수치로, AI가 인간보다 높은 점수를 기록한 것은 처음이다.

LG CNS가 운영하는 기계 독해 능력 평가는 미국 스탠포드 대학에서 시작된 AI 언어지능 연구용 질의응답 학습 데이터셋인 SQuAD(The Stanford Question Answering Dataset)와 동일한 방식으로 구현된다.

LG CNS는 지난해 12월 한국어 학습을 위한 데이터인 KorQuAD를 구축해 오픈소스로 공개했으며, 누구나 이를 바탕으로 학습한 자체 개발 AI 언어모델을 제출해 성능을 공식 평가 받을 수 있다.

 

▲ LG CNS

평가는 데이터셋에서 추출한 내용을 질문으로 제시하고, 이에 대해 개발 모델이 답을 찾아내는 방식으로 이루어진다.

예를 들어 "아이유는 1993년 5월 16일 서울특별시에서 태어났으며, 경기도 하남시와 의정부시를 거쳐 서울특별시 광진구에서 자랐다. 초등학교는 하남시의 하남천현초등학교에서 3학년까지 다니다가 서울 광진구의 서울양남초등학교로 전학가 졸업하였다"와 같은 지문이 주어지고, "아이유가 졸업한 초등학교는 어디인가?"라는 질문에 대해 "서울양남초등학교"라는 정답을 찾아내는 식이다.

이번에 평가받은 카카오의 AI 언어모델(모델명: BERT LM fine-tuned (single) + KHAIII)은 구글의 AI 언어모델 BERT(Bidirectional Encoder Representations from Transformers)에 카카오의 형태소 분석기 'khaiii(Kakao Hangul Analyzer III)’를 접목한 것으로 조사의 사용과 어미의 다양한 변형 등 한국어의 고유 특성에 최적화된 것이다.

카카오는 지난해 말 딥러닝 기술 기반의 형태소 분석기 khaiii를 국내 최초 오픈소스로 제공해 국내 AI 기반 언어지능 연구 발전을 위해 노력하고 있다.

카카오 자연어처리파트의 김응균 파트장은 "이번 평가 결과는 카카오의 인공지능 자연어 처리 기술을 활용해 인간의 독해 능력을 넘어서는 최초의 모델을 구현했다는 점에서 높이 평가받을 만 하다"며 "금번 개발한 언어모델 기술을 스마트 스피커 카카오미니에 적용하기 위한 연구를 진행 중"이라고 밝혔다.

KPI뉴스 / 김들풀 전문기자 itnews@kpinews.kr

[저작권자ⓒ KPI뉴스. 무단전재-재배포 금지]