무슨 일이 있었나
Apple Machine Learning 연구자들은 다국어 언어 모델이 저자원 표적 언어에 대한 지식을 고자원 언어로부터 어떻게 획득할 수 있는지 조사하고 있다.
이 작업은 표적 언어 훈련 데이터가 제한된 상황에서 과학적 추론, 상식 추론, 세계 지식과 같은 작업을 지원하는 방법으로 어휘 개입에 초점을 맞춘다.
교차 언어 지식 전이를 위한 기존 접근법은 일반적으로 대량의 병렬 데이터, 번역 시스템, 보조 모델 또는 추가 훈련 단계를 필요로 한다.
왜 중요한가
많은 언어는 자체적으로 고성능 모델을 구축할 충분한 훈련 데이터가 부족하므로, 고자원 언어로부터의 효과적인 전이는 실용적인 다국어 시스템에 필수적이다.
어휘 개입이 대규모 병렬 데이터와 추가 구성 요소에 대한 요구를 줄일 수 있다면, 교차 언어 지식 전이는 더 넓은 범위의 언어에 대해 더 실현 가능해질 수 있다.
주요 사실
교차 언어 지식 전이는 훈련 데이터가 불충분한 언어를 서비스하는 다국어 모델에 중요하다.
표적 언어 데이터가 부족할 때 지식은 주로 고자원 언어에서 온다.
기존 전이 개선 방법은 대규모 병렬 데이터, 번역 시스템, 보조 모델 또는 추가 훈련 단계를 요구한다.
다음에 주목할 점
어휘 개입 기법이 다양한 하류 작업과 언어 쌍에 걸쳐 작동하는지 여부.
이 방법이 실제 저자원 환경에서 기존의 자원 집약적 전이 접근법과 어떻게 비교되는지.
