Statistical Machine Translation
DocHPLT: A Multilingual Document-Level Translation Dataset
Pages
15
Time to read
44 mins
Publication
Language
English
Pages
15
Time to read
44 mins
Publication
Language
English
This technical report presents DocHPLT, a large multilingual document-level translation dataset designed to enhance the training and evaluation of document-level machine translation (DocMT). The dataset comprises 124 million aligned document pairs across 50 languages paired with English, totaling 4.26 billion sentences. The authors detail their methodology, which modifies existing web extraction pipelines to preserve complete document integrity, retaining all content, including unaligned portions. This approach contrasts with traditional reconstruction-based methods that often lose document structure. The report outlines preliminary experiments that identify optimal training strategies for large language models (LLMs) fine-tuned on DocHPLT, demonstrating significant performance improvements, particularly for under-resourced languages. The findings indicate that LLMs trained on this dataset outperform standard instruction-tuned models. The authors emphasize the importance of this resource in addressing the data gap in document-level translation for various languages, providing essential infrastructure for future research in multilingual translation.