오픈 대규모 언어 모델을 활용한 다국어 기계 번역의 참조 불필요 후처리 학습
Reference-Free Post-Training of Open Large Language Models for Multilingual Machine Translation
본 연구에서는 오픈 대규모 언어 모델을 사용하여 다국어 기계 번역에 대한 참조 불필요 후처리 학습 방법을 연구합니다. 지도 학습으로 미세 조정된 MiLMMT-46-v0.1 모델을 기반으로, 언어 식별을 통해 제어되는 두 개의 참조 불필요 품질 평가 모델의 평균값을 보상으로 사용하는 Group Relative Policy Optimization (GRPO)를 적용했습니다. 이후, 지도 학습(SFT)과 강화 학습(RL) 모델 체크포인트를 선형적으로 결합하여 MiLMMT-46-v1.0을 얻었습니다. 46개 언어에 걸쳐, 결과 모델은 기존의 SFT 모델보다 일관되게 번역 품질이 향상되었으며, Seed-X, HY-MT2, TranslateGemma와 같은 강력한 최신 오픈 소스 모델보다 뛰어난 성능을 보였습니다. 또한, Google Translate, Gemini 3 Pro, GPT-5와 같은 상용 시스템에 대한 참조 불필요 평가에서 최고 수준의 점수를 달성했습니다. 추가적으로 온정책 증류(OPD)를 조사한 결과, 체크포인트 결합을 사용한 RL 방식이 달성하는 품질 수준에 도달하지만 능가하지는 못함을 확인했습니다. 본 연구에서는 개발된 모델과 코드를 공개하여 향후 연구를 지원하고자 합니다.
We study reference-free post-training for multilingual machine translation with open large language models. Starting from the supervised-finetuned MiLMMT-46-v0.1 models, we apply Group Relative Policy Optimization (GRPO) with a reward that averages two reference-free quality estimation models and is gated by language identification. We then linearly interpolate the supervised fine-tuning (SFT) and reinforcement learning (RL) model checkpoints to obtain MiLMMT-46-v1.0. Across 46 languages, the resulting models consistently improve translation quality over their SFT counterparts, outperform strong recent open baselines, including Seed-X, HY-MT2, and TranslateGemma, and achieve leading reference-free scores against evaluated proprietary systems such as Google Translate, Gemini 3 Pro, and GPT-5. We further investigate on-policy distillation (OPD) and find that it reaches, but does not surpass, the quality frontier achieved by RL with checkpoint interpolation. We release the models and code to facilitate future research.
No Analysis Report Yet
This paper hasn't been analyzed by Gemini yet.
Log in to request an AI analysis.