Google AI 언어 모델: 300개 이상의 언어 사용 가능
블로그

Google AI 언어 모델: 300개 이상의 언어 사용 가능

Google의 범용 음성 모델(USM)는 언어 지원을 300개 이상의 언어로 확장했습니다. 이는 검색 대기업이 1,000개 언어에서 작업한다는 궁극적인 목표에 한 걸음 더 다가가는 인상적인 이정표입니다. 이 발표는 가능한 한 많은 언어를 포함하는 머신 러닝 모델을 구축하겠다는 회사의 약속의 결과입니다.

표준 인코더-디코더 아키텍처인 USM은 Conformer를 사용하여 음성 신호의 log-mel 스펙트로그램을 입력으로 받고 합성 서브 샘플링을 수행합니다. 이 모델은 12억 개의 매개변수를 가지고 있으며 28만 시간의 음성과 XNUMX억 개의 문장의 텍스트로 훈련되었습니다. 더 간단히 말해서, 구글연구원들은 레이블이 지정되지 않은 대규모 다국어 데이터 세트를 사용하여 모델을 사전 훈련한 후 레이블이 지정된 소규모 데이터 세트를 사용하여 모델을 세부적으로 조정했습니다.

이 접근 방식은 이전 기술보다 더 효과적이며, 이 모델은 이미 YouTube에서 아므하라어, 세부아노어, 아삼어, 아제르바이잔어 등과 같은 자원이 부족한 언어에 대한 폐쇄형 자막을 생성하는 데 사용되고 있습니다. USM은 다음을 달성합니다. 30% 미만의 단어 오류율 YouTube에서는 평균 73개 언어로 제공됩니다.

에 비해 OpenAI의 Whisper 모델, USM은 약 18개 언어에 대해 비교적 낮은 단어 오류율을 보입니다. 그러나 회사의 높은 목표를 달성하기 위해서는 언어 범위와 품질을 모두 확장하기 위해 계산 효율성을 개선해야 합니다.

결론적으로

Google의 USM은 인상적인 업적입니다. 기계 학습 자연어 처리의 표준을 설정합니다. 언어 지원이 확대됨에 따라 이 모델은 혁신을 계속 추진하고 전 세계적으로 자원이 부족한 언어에 대한 접근성을 제공할 것입니다.

당신의 반응은 무엇입니까?

흥분한
0
행복하다
0
사랑에
0
확실하지 않다
0
바보
0
마크 보그
마크는 로봇 공학을 전문으로 합니다. 공학과 AI 모두에서 배경을 가진 그는 최첨단 기술을 창조하는 데 열정적입니다. 여가 시간에는 체스를 두며 전략을 연습하는 것을 즐깁니다.

    당신은 또한 같은 수 있습니다

    추가 :블로그