传统SMT系统中短语翻译概率完全由频次决定,高频短语得分高,但很多合理的低频翻译却因为没出现过几次而得分很低。RNN编码器-解码器采取了一个巧妙的学习策略——训练时完全忽略短语对的频次信息,只使用唯一种类。这样一来,模型被迫去学习短语本身的语义和语法模式,而非单纯的统计共现。
这种“去频率化”训练的效果在定性分析中展露无遗。作者随机选取了一些长短语,比较传统翻译模型和RNN编码器-解码器给它们打出的top-3目标短语:
表2:长源短语在翻译模型(左侧)和RNN编码器-解码器(右侧)下的top-3目标短语对比。注意RNN编码器-解码器给出的翻译更接近字面含义且更通顺。
例如,对于“at the end of the”这个高频短语,传统翻译模型给出的top-1是"à la fin de la"(完全正确),但后续选项却出现了奇怪内容;而RNN编码器-解码器给出的三个选项都是合理的法语表达。对于低频短语如"Minister of Communications and Transport",传统模型的选项几乎不可用,而RNN给出的"Secrétaire aux communications et aux transports"则是标准的翻译。
更惊艳的是,RNN编码器-解码器甚至能直接从零生成目标短语,而不需要查阅短语表。作者从训练好的模型中采样了50个目标短语,按分数排序后展示:
表3:从RNN编码器-解码器对每个源短语生成的样本(top-5)。展示模型无需短语表即可生成合理翻译。
例如,输入"at the end of the",模型采样出了"à la fin de la"(出现了11次)、"à la fin des"等。生成的短语与短语表中的实际短语并不完全重合,说明模型确实“学会”了如何翻译,而不是死记硬背。
图3将每个短语对的得分进行了可视化对比:传统翻译模型的得分(y轴)与RNN编码器-解码器的得分(x轴)。可以看到,很多短语对两个模型打分相似,但也有大量短语对打分差异很大,这说明RNN模型提供了与传统统计不同的、互补的信息。
图3:短语对得分可视化。横轴为RNN编码器-解码器的得分(log概率),纵轴为传统翻译模型的得分。红色对角线表示打分一致,散布的点显示差异。
Cho, K., van Merrienboer, B., Gulcehre, C., Bahdanau, D., Bougares, F., Schwenk, H., & Bengio, Y. (2014). Learning Phrase Representations using RNN Encoder–Decoder for Statistical Machine Translation. In Proceedings of the 2014 Conference on Empirical Methods in Natural Language Processing (EMNLP), 1724–1734.Bahdanau, D., Cho, K., & Bengio, Y. (2015). Neural Machine Translation by Jointly Learning to Align and Translate. In Proceedings of ICLR.Hochreiter, S., & Schmidhuber, J. (1997). Long Short-Term Memory. Neural Computation, 9(8), 1735–1780.Schwenk, H. (2012). Continuous Space Translation Models for Phrase-Based Statistical Machine Translation. In Proceedings of COLING.Mikolov, T., et al. (2013). Distributed Representations of Words and Phrases and their Compositionality. In NIPS.