Google翻譯不怕惡作劇 別想積非成是
Google台灣董事總經理簡立峰說,Google翻譯比以前好用太多了!就算有人惡作劇,刻意在「提出修改建議」欄位寫下錯的翻譯,也不會影響系統的運作。
簡立峰解釋,Google翻譯有學習及資料庫的功能,不斷累積經驗,錯誤也是一種經驗,除非幾乎所的人都在「修改建議」欄寫下一模一樣的錯誤,才會積非成是,但事實上這種情況並不可能發生。
他認為,雖然簡體中文、繁體中文有些相同的字詞有著不同的意義,或相同的字已衍生出新的意義,但因簡體、繁體中文語法相同,在機器翻譯上仍採用一套系統,可視為專有名詞,透過學習建立資料庫來校正。
其實不只簡體中文、繁體中文的語法相同,他透露,日文、韓文在機器翻譯上也可算是語法相同,用同一套系統。
他指出,機器學習是很重要的議題,大家在討論Google翻譯的學習功能之際,也會聯想到人工電腦AlphaGo打敗真人世界棋王。現在也有人提出讓AlphaGo打AlphaGo,學習能力可以更快的說法,就像是金庸小說「華山論劍」裡全真派的周伯通,用自己的左手和右手對打,使出的「左右互搏」。
Google翻譯的發展進程快速,10年前,Google推出翻譯服務,並以片語式機器翻譯(Phrase-BasedMachine Translation)作為主要運算方式。從過去僅支援幾種語言,到現在可支援103種語言,且每天翻譯超過1400億個單詞,Google翻譯的品質有了很大的進展。
數年前,Google採用遞歸神經網絡(RecurrentNeural Networks)將句子視為一個單位進行翻譯,之後的片語式機器翻譯方式(PBMT),則是將句子切割成單獨的字和詞組做獨立翻譯。
過去,為翻譯任意兩種語言,Google需要建構多個不同的翻譯系統,運算成本相當可觀。相較於過去的片語機器學習(PBMT),神經機器翻譯(NMT)僅需要較少的系統架構設計。剛開始推出神經機器翻譯時,這兩種翻譯方式的精準度不相上下。
為改善NMT翻譯品質,研究人員提出許多技術來解決,這當中包括透過模擬調校模型(externalalignment model) 處理罕見字詞、使用「注意」(attention)來對準輸入詞和輸出詞,以及將詞拆解成更小的單元以應對罕見字詞等。
Google神經機器翻譯(GNMT)將中文句子翻譯成英文句子的過程,透過編碼器 (Encoder),首先,GNMT將中文句子的每一個單詞進行向量(vector)編碼,而每個向量將顯示出目前為止單詞被讀取到的所有意義。
在讀取完整句子後,解碼器(Decoder)就會開始運作,一次產生一個英語句子中的一個詞。
注意 (Attention)功能是為了每一步都產出正確的詞,解碼器將針對編碼中文向量裡最相關的英文單詞權重分布(weighted distribution)進行解碼。
台灣是Android版Google翻譯成長最快的市場
你知道嗎?每三個網路使用者,就有一個人經常使用Google翻譯。
Google指出,Google翻譯每天進行超過10億次的翻譯,大約等於100萬本書的字數。每月超超過10億的活躍使用者。
台灣是Android版Google翻譯成長最快的市場
有92%的Google翻譯使用者來自美國以外的國家,且在巴西有最多的使用者。
台灣是Android版Google翻譯成長最快的市場。和2015年比較起來,2016年台灣使用者Android版年成長2倍,iOS版,台灣使年成長60%。
Google台灣董事總經理簡立峰指出,為了顧及資料量,繁體中文與簡體中文文法語言結構也相同,繁體中文和簡體中文共用同一個資料庫。而在翻譯品質精進的部分,除了單靠Google研發團隊的努力,「社群」校正的力量也是非常重要的。
Google神經機器翻譯(NMT)發展進度超前
以往Google翻譯以片語式機器翻譯(Phrase-Based Machine Translation)作為主要運算方式。將句子切割成小塊語言單位,之後針對各別語言塊進行翻譯,最後再將這些語言塊組合成看似句子的目標語言。
而2016年九月宣布的Google神經機器翻譯系統(Google Neural Machine Translation,GNMT),則是將整個輸入的句子視為一個單位進行翻譯。神經機器翻譯能夠打造出更好的翻譯品質,大幅降低了相對誤差,讓機器翻譯的品質更接近譯者。
Google翻譯產品經理卡蒂奥(Julie Cattiau)指出,神經機器翻譯技術(NMT)的複雜模型架構需要8個Google處理器(Google processing units)來運算,因此每個模型的訓練需花費數週的時間。而每個GNMT模型的訓練時間約2-3週,而每個模型需超過1億筆訓練案例。目前,Google翻譯現有的語言組共達1,032組。
雖是如此,GNMT發展速度卻超前,原先預期需耗時36個月才能完成神經機器翻譯導入Google翻譯的服務,最後導入成果超乎預期,僅耗時13.5個月。
多語言互譯:Zero-Shot翻譯系統
面對多種語言翻譯的情境,Zero-Shot讓兩種語言經過訓練後可自動學習,且不需額訓練就能自動翻譯另一種全新語言。
舉例而言,Zero-Shot翻譯在進行英日、韓英翻譯訓練後,不僅可完成英日、日英、英韓、韓英的互譯,更可在藉由導入Zero-Shot翻譯就能完成之前沒有經過任何相關訓練的第三種語言。
如韓日、日韓的互譯。藉由Zero-Shot翻譯,Google僅需要一套系統就能完成所有語言的互譯。
目前推出的16組語言組中,共有10組語言組已經採用Google神經機器翻譯系統(GNMT)。而透過強大的運算,在短短兩個月內將10秒翻譯一句話的速度,縮短到0.2秒就能完成。
Google 翻譯的下一步
Google指出,提早截斷(Early Cutoff), 適時地截斷或捨棄來源句子裡的單詞、加強數字與日期翻譯、簡短、罕見字串的翻譯與名詞與品牌翻譯都是Google下個階段努力的目標。
日文、韓文在機器翻譯上也可算是語法相同,用同一套系統?
原來如此!難怪「英語」「日本語」的翻譯結果非常的差!
另外,「簡體、繁體中文語法相同」也是「原來如此」!難怪「繁體中文」翻譯結果非常差!怎麼看都是簡體中文!![]()
