Google翻譯比以前好用太多了!就算有人惡作劇,也不會影響系統的運作

Google翻譯不怕惡作劇 別想積非成是

Google台灣董事總經理簡立峰說,Google翻譯比以前好用太多了!就算有人惡作劇,刻意在「提出修改建議」欄位寫下錯的翻譯,也不會影響系統的運作。

簡立峰解釋,Google翻譯有學習及資料庫的功能,不斷累積經驗,錯誤也是一種經驗,除非幾乎所的人都在「修改建議」欄寫下一模一樣的錯誤,才會積非成是,但事實上這種情況並不可能發生。

他認為,雖然簡體中文、繁體中文有些相同的字詞有著不同的意義,或相同的字已衍生出新的意義,但因簡體、繁體中文語法相同,在機器翻譯上仍採用一套系統,可視為專有名詞,透過學習建立資料庫來校正。

其實不只簡體中文、繁體中文的語法相同,他透露,日文、韓文在機器翻譯上也可算是語法相同,用同一套系統。

他指出,機器學習是很重要的議題,大家在討論Google翻譯的學習功能之際,也會聯想到人工電腦AlphaGo打敗真人世界棋王。現在也有人提出讓AlphaGo打AlphaGo,學習能力可以更快的說法,就像是金庸小說「華山論劍」裡全真派的周伯通,用自己的左手和右手對打,使出的「左右互搏」。

Google翻譯的發展進程快速,10年前,Google推出翻譯服務,並以片語式機器翻譯(Phrase-BasedMachine Translation)作為主要運算方式。從過去僅支援幾種語言,到現在可支援103種語言,且每天翻譯超過1400億個單詞,Google翻譯的品質有了很大的進展。

數年前,Google採用遞歸神經網絡(RecurrentNeural Networks)將句子視為一個單位進行翻譯,之後的片語式機器翻譯方式(PBMT),則是將句子切割成單獨的字和詞組做獨立翻譯。

過去,為翻譯任意兩種語言,Google需要建構多個不同的翻譯系統,運算成本相當可觀。相較於過去的片語機器學習(PBMT),神經機器翻譯(NMT)僅需要較少的系統架構設計。剛開始推出神經機器翻譯時,這兩種翻譯方式的精準度不相上下。

為改善NMT翻譯品質,研究人員提出許多技術來解決,這當中包括透過模擬調校模型(externalalignment model) 處理罕見字詞、使用「注意」(attention)來對準輸入詞和輸出詞,以及將詞拆解成更小的單元以應對罕見字詞等。

Google神經機器翻譯(GNMT)將中文句子翻譯成英文句子的過程,透過編碼器 (Encoder),首先,GNMT將中文句子的每一個單詞進行向量(vector)編碼,而每個向量將顯示出目前為止單詞被讀取到的所有意義。

在讀取完整句子後,解碼器(Decoder)就會開始運作,一次產生一個英語句子中的一個詞。

注意 (Attention)功能是為了每一步都產出正確的詞,解碼器將針對編碼中文向量裡最相關的英文單詞權重分布(weighted distribution)進行解碼。

台灣是Android版Google翻譯成長最快的市場

你知道嗎?每三個網路使用者,就有一個人經常使用Google翻譯。

Google指出,Google翻譯每天進行超過10億次的翻譯,大約等於100萬本書的字數。每月超超過10億的活躍使用者。

台灣是Android版Google翻譯成長最快的市場

有92%的Google翻譯使用者來自美國以外的國家,且在巴西有最多的使用者。

台灣是Android版Google翻譯成長最快的市場。和2015年比較起來,2016年台灣使用者Android版年成長2倍,iOS版,台灣使年成長60%。

Google台灣董事總經理簡立峰指出,為了顧及資料量,繁體中文與簡體中文文法語言結構也相同,繁體中文和簡體中文共用同一個資料庫。而在翻譯品質精進的部分,除了單靠Google研發團隊的努力,「社群」校正的力量也是非常重要的。 

Google神經機器翻譯(NMT)發展進度超前

以往Google翻譯以片語式機器翻譯(Phrase-Based Machine Translation)作為主要運算方式。將句子切割成小塊語言單位,之後針對各別語言塊進行翻譯,最後再將這些語言塊組合成看似句子的目標語言。

而2016年九月宣布的Google神經機器翻譯系統(Google Neural Machine Translation,GNMT),則是將整個輸入的句子視為一個單位進行翻譯。神經機器翻譯能夠打造出更好的翻譯品質,大幅降低了相對誤差,讓機器翻譯的品質更接近譯者。

Google翻譯產品經理卡蒂奥(Julie Cattiau)指出,神經機器翻譯技術(NMT)的複雜模型架構需要8個Google處理器(Google processing units)來運算,因此每個模型的訓練需花費數週的時間。而每個GNMT模型的訓練時間約2-3週,而每個模型需超過1億筆訓練案例。目前,Google翻譯現有的語言組共達1,032組。

雖是如此,GNMT發展速度卻超前,原先預期需耗時36個月才能完成神經機器翻譯導入Google翻譯的服務,最後導入成果超乎預期,僅耗時13.5個月。 

多語言互譯:Zero-Shot翻譯系統 

面對多種語言翻譯的情境,Zero-Shot讓兩種語言經過訓練後可自動學習,且不需額訓練就能自動翻譯另一種全新語言。

舉例而言,Zero-Shot翻譯在進行英日、韓英翻譯訓練後,不僅可完成英日、日英、英韓、韓英的互譯,更可在藉由導入Zero-Shot翻譯就能完成之前沒有經過任何相關訓練的第三種語言。

如韓日、日韓的互譯。藉由Zero-Shot翻譯,Google僅需要一套系統就能完成所有語言的互譯。

目前推出的16組語言組中,共有10組語言組已經採用Google神經機器翻譯系統(GNMT)。而透過強大的運算,在短短兩個月內將10秒翻譯一句話的速度,縮短到0.2秒就能完成。 

Google 翻譯的下一步

Google指出,提早截斷(Early Cutoff), 適時地截斷或捨棄來源句子裡的單詞、加強數字與日期翻譯、簡短、罕見字串的翻譯與名詞與品牌翻譯都是Google下個階段努力的目標。


日文、韓文在機器翻譯上也可算是語法相同,用同一套系統?think原來如此!難怪「英語」「日本語」的翻譯結果非常的差!hit另外,「簡體、繁體中文語法相同」也是「原來如此」!難怪「繁體中文」翻譯結果非常差!怎麼看都是簡體中文!cant

🍎たったひとつの真実見抜く、見た目は大人、頭脳は子供、その名は名馬鹿ヒカル!🍏

Google 翻譯解密,導入神經機器學習讓翻譯結果更像「人話」

台灣 Google 今日邀請美國 Google 翻譯產品經理 Julie Cattiau 分享 Google 在翻譯上的斬獲,相較於過去單字翻譯成單字的技術,Google 自 2015 年秋季開始導入神經機器翻譯技術,讓不同語言間的翻譯變得更加連續且順暢,實際上是怎麼運作的呢?以下是 Google 的說明。

為什麼 Google 這麼重視 Google 翻譯的發展?因為網路上有 50% 的內容是以英文呈現,但全球以英文為主要使用語言的使用者大概只有 20%,為了讓全世界的資訊可以更順暢的流通,因此翻譯服務扮演著很重要的角色,同時 Google 翻譯也整合了其他 Google 產品,包含 Chrome、Google 搜尋、Gmail、YouTube 等等,讓使用者在需要翻譯的時候都能取得翻譯服務。

根據 Google 的統計,全世界每天進行超過 10 億次的翻譯,每月有超過 10 億的活躍使用者(代表每 3 個網路使用者中就有 1 個是 Google 翻譯的常用者),有 92% 的 Google 翻譯使用者來自美國以外的國家,其中巴西是最大中的使用者,台灣則是 Google 翻譯成長最快的市場,以 Android 版來說,Google 翻譯每年成長兩倍,iOS 版也有 60% 的年成長。

從片段式 Google 翻譯到神經機器翻譯

相信不少人都有使用過 Google 翻譯的經驗,過去舊版的 Google 翻譯是以一個字對應一個字,例如雞對應到 Chicken、湯對應到 Soup 來進行翻譯,雞湯就變成 Chicken Soup,這樣的翻譯雖然不會有大錯,重點字都可以被翻譯出來,不過語意不一定容易被人理解,順暢度也比不上一般人說出來的話。

現在 Google 將從過去的片語式機器翻譯變成神經機器翻譯,以前的翻譯結果看起來會比較分離且片面,改用新的神經機器翻譯後會得到更連續且全面的結果。在這樣的努力下,中翻英的品質大幅提升,大部分的語言組合也有不錯的品質成長。

以川普就職典禮的一段話為例,在神經網路翻譯導入前,Google 英翻中的結果雖然重點都有被抓出來,不過語意不夠順暢,導入神經網路翻譯後,英翻中的結果更像一般人說出來的語句。

原文:We will build new roads and highways and bridges and airports and tunnels and railways all across our wonderful nation. We will get our people off of welfare and back to work, rebuilding our country with American hands and American labor.

舊 Google 翻譯:我們將建設新的道路和公路,橋樑,機場,隧道和鐵路所有在我們美好的國家。我們將讓我們的人民過福利和恢復工作,重建我們的國家與美國的雙手和美國勞工。

新 Google 翻譯:我們將在美好的國家建設新的道路,公路和橋樑,機場,隧道和鐵路。我們將使我們的人民擺脫福利,重返工作,用美國的手和美國勞工重建我們的國家。

原本 Google 預計需要三年的時間才能推出神經機器翻譯技術,不過實際上只花了 13.5 個月就將翻譯成品陸續上線,成果超乎預期。自 2015 年 9 月 Google 開始以 TensorFlow 為核心執行專案,2016 年 2 月就取得了第一次產品的數據報告,2016 年 9 月就將新的中英翻譯上線,2016 年 11 月後則開始陸續推出更多語言,累積至今已提供 41 種語言對譯功能。

透過資料庫訓練的神經機器翻譯技術

相較於過去的 Google 翻譯,新的神經機器翻譯技術(NMT)模型架構較以前複雜許多,神經機器的翻譯模型並不是自動生成的,而是需要大量的模型訓練,每個模型訓練時間大約落在 2 至 3 週間,每種模型需要訓練的案例數量超過 1 億筆,由於有太多語言模型需要訓練,因此 Google 採用多元語言模式訓練,比方說將英文、日文、韓文放在一起相互訓練,讓兩種語言經過訓練後自動學習,不用額外訓練就可以自動翻譯另外一種全新語言(Zero-Shot),翻譯速度也變更快。

不過像是語法相似的繁體中文與簡體中文,Google 不諱言目前神經機器的中英翻譯目前尚還無法分別出台灣與中國用詞的差異,舉例來說像是台灣的水準和中國的水平、台灣的品質和中國的質量這類單字。由於繁中與簡中目前各別的資料庫還不足以訓練神經機器,因此兩套語言目前是套用同一套翻譯模型,只是單字從各自不同的資料庫來,神經機器翻譯比較大的斬獲是可以透過前後文推敲讓語句變得更順暢,可以降低誤差。

另外,如果一個句子混合了兩種語言,例如中英夾雜,這種翻譯結果 Google 目前為止是不翻譯英文,只將中文翻譯成英文,但未來會致力朝向翻譯全句語言讓他更順暢。

比起中英對譯目前有資料庫不足的瓶頸,有些雙語並行的國家就提供了 Google 翻譯更精準的資料庫,像是加拿大是英法雙與並行,因此 Google 可以取得一句英文、一句法文對應精準的翻譯,因此翻譯的準確度較高,同時,如果輸入越正式的句子至 Google 翻譯中,也能得到更準確的翻譯結果(因為越正式的句子翻譯資料庫比較豐富)。

神經機器翻譯應用:即時鏡頭翻譯

除了單純文字的翻譯之外,Google 也介紹了另外一種神經網路應用:即時鏡頭翻譯(Word Lens),這功能實際上是怎麼運作的呢?首先 Google 翻譯必須先從鏡頭拍攝的圖片裡找出目標文字,接著 Google 翻譯會透過深度學習技術辨識出每個文字,最後系統會在字典庫尋找並轉換出對應的翻譯結果。

Google 翻譯的下一步,將加強數字和日期的翻譯、簡短和罕見的查詢字串、名字和品牌翻譯,期望讓翻譯的結果更加精準也更人性化。


我看到的翻譯還是舊的!cant

我們將建設新的道路和公路,橋樑,隧道,鐵路和機場都在我們美好的國家。我們將讓我們的人民過福利和恢復工作,重建我們的國家與美國的雙手和美國勞工。

這是「Bing翻訳」的結果,很顯然是「文法」是「中國簡體中文」的「繁體中文版」!yell當然Google也一樣!yell

我們將修建新的道路、高速公路、橋樑、機場、隧道和鐵路。我們將使我們的人民擺脫福利, 重返工作崗位, 用美國的雙手和美國勞動來重建我們的祖國。

🍎たったひとつの真実見抜く、見た目は大人、頭脳は子供、その名は名馬鹿ヒカル!🍏