KPI뉴스 - 엔씨소프트-고려대, AI 대화 데이터셋 공개한다

  • 구름많음정읍26.2℃
  • 맑음원주27.7℃
  • 구름많음속초27.4℃
  • 흐림울산26.7℃
  • 흐림포항27.9℃
  • 맑음정선군24.0℃
  • 맑음부여26.5℃
  • 흐림여수29.0℃
  • 구름많음추풍령23.6℃
  • 맑음북강릉26.6℃
  • 맑음대전27.7℃
  • 맑음춘천25.4℃
  • 맑음태백22.2℃
  • 구름많음진주24.7℃
  • 흐림김해시28.8℃
  • 구름많음울릉도27.7℃
  • 구름많음합천24.7℃
  • 맑음강릉27.1℃
  • 맑음수원29.3℃
  • 구름많음흑산도28.2℃
  • 흐림고흥28.2℃
  • 흐림성산29.1℃
  • 흐림완도28.7℃
  • 흐림의령군25.5℃
  • 흐림장흥28.3℃
  • 흐림보성군27.6℃
  • 맑음안동25.3℃
  • 구름많음임실24.4℃
  • 구름많음함양군24.1℃
  • 맑음청송군22.3℃
  • 맑음청주30.0℃
  • 맑음울진25.7℃
  • 흐림양산시29.0℃
  • 흐림경주시26.7℃
  • 맑음금산24.3℃
  • 맑음양평28.3℃
  • 맑음충주26.6℃
  • 구름많음고창군25.3℃
  • 흐림북창원29.2℃
  • 맑음제천24.4℃
  • 맑음군산27.9℃
  • 구름많음순천23.8℃
  • 맑음상주25.2℃
  • 흐림밀양26.5℃
  • 맑음동해26.6℃
  • 맑음세종27.3℃
  • 흐림강진군29.0℃
  • 흐림해남29.5℃
  • 맑음파주24.5℃
  • 맑음전주27.0℃
  • 맑음홍천26.2℃
  • 맑음보은23.8℃
  • 맑음영덕24.4℃
  • 맑음이천26.2℃
  • 맑음봉화21.8℃
  • 구름많음고산28.0℃
  • 박무홍성26.4℃
  • 맑음영주24.2℃
  • 맑음철원25.9℃
  • 흐림남해27.5℃
  • 구름많음영광군26.7℃
  • 흐림서귀포29.0℃
  • 구름많음광주29.2℃
  • 흐림북부산28.7℃
  • 흐림통영28.4℃
  • 구름많음남원27.5℃
  • 맑음인천30.1℃
  • 구름많음산청24.8℃
  • 구름많음구미27.3℃
  • 맑음서산27.4℃
  • 흐림진도군26.7℃
  • 맑음의성24.0℃
  • 맑음부안26.7℃
  • 구름많음창원28.5℃
  • 맑음서울29.2℃
  • 흐림부산28.9℃
  • 구름많음장수21.7℃
  • 맑음영월24.7℃
  • 구름많음목포29.2℃
  • 구름많음대구27.2℃
  • 맑음북춘천26.4℃
  • 구름많음순창군24.6℃
  • 맑음천안25.8℃
  • 맑음서청주25.9℃
  • 흐림거제28.3℃
  • 구름많음거창23.7℃
  • 맑음인제24.3℃
  • 맑음보령28.0℃
  • 맑음문경24.0℃
  • 구름많음고창
  • 구름많음영천24.5℃
  • 흐림제주28.9℃
  • 맑음백령도26.5℃
  • 흐림광양시28.7℃
  • 구름많음대관령22.7℃
  • 맑음강화26.9℃
  • 맑음동두천26.8℃

엔씨소프트-고려대, AI 대화 데이터셋 공개한다

김해욱 Google구글에서 선호하는 출처로 추가
기사승인 : 2022-04-14 15:12:25
임희석 교수 연구팀과 공동연구 진행 엔씨소프트가 임희선 고려대학교 교수 연구팀과 공동으로 구축한 AI(인공지능) 대화 데이터 '포커스 데이터셋(FoCus Dataset, For Customized conversation dataset)을 공개했다고 14일 밝혔다.

포커스 데이터셋은 이용자 개인의 페르소나(지혜와 자유의사를 갖는 독립된 인격적 실체)와 외부 지식 모두를 활용하는 세계 최초의 AI 대화 데이터셋이다. 약 8000여 개의 주제를 다룬 1만5000개 이상의 대화로 구성됐다.

▲ 엔씨소프트와 임희석 고려대학교 교수 연구팀이 공동개발한 'FoCus Dataset'(For Customized conversation dataset)의 대화 방식 참고 이미지. [엔씨소프트 제공]

이 데이터셋이 적용된 AI는 대화하는 이용자의 경험, 선호, 소유, 흥미 등을 파악해 위키피디아와 같은 곳에서 이야기 중인 주제에 대해 최신 지식을 실시간으로 습득, 관련 대화가 자연스럽게 이어지도록 한다.

엔씨소프트는 "기존의 일반적인 대용량 언어모델은 학습, 추론에 상당한 비용이 소요됨에도 실시간 지식을 반영하는 것에 한계가 있다"며 "포커스데이터셋은 이러한 거대 언어 모델 없이도 같은 성능의 대화 기술 구현이 가능한 것이 특징"이라고 설명했다.

엔씨소프트와 고려대 공동연구팀은 지난 2월 인공지능 학회 'AAAI 2022'에 참가해 관련 연구 논물을 게재하고 발표한 바 있다. 올해  10월에는 세계 전사언어학회 'COLING 2022'에서 데이터 활용 경진 대회 등의 연구 성과를 공유하는 워크샵을 개최할 예정이다.

이연수 엔씨소프트 랭귀지 에이랩(Language AI Lab) 실장은 "최근 NLP(Language AI Lab) 학계에서는 비용 및 환경 문제로 초거대 언어모델 기반의 대화 기술에 필적할 대화 기술들이 제안되고 있다"며 "연구 방향에 공감하는 차원에서 이번 데이터 공개를 결정했고 글로벌 연구 커뮤니티에서 활발한 논의와 기술 개발이 이뤄지길 기대한다"고 말했다.

KPI뉴스 / 김해욱 기자 hwk1990@kpinews.kr

[저작권자ⓒ KPI뉴스. 무단전재-재배포 금지]

김해욱
김해욱

기자의 인기기사