語音 AI 如何解讀廣東話?從聲調到中英夾雜的技術拆解

2026年7月28日·下午12:19·預計閱讀時間: 9–11 分鐘閱讀

用 AI 總結本文(點選其中一個模型,然後按 ctrl+v)

GeminiChatGPTClaudePerplexityGrok

為何「理解廣東話」比聽起來更困難

當一位香港住戶致電管理處說「落雨喇,天台又漏水」——你瞬間便能理解。你聽到這些字詞,知道它們的意思,也知道接下來要做甚麼。

機器卻聽不到這些。它聽到的是聲波:一條隨時間變化的空氣壓力曲線。人類自動完成的一切——區分詞語、理解哪個字詞被使用、掌握說話意圖——機器都必須被教導如何從原始聲音中重建出來。

語音 AI 有三項工作,按順序進行。第一,聆聽:將聲音轉化為文字。第二,理解:理解文字的真正含義及來電者的意圖。第三,回應:回答問題,或觸發記錄工單等行動。本文主要討論第一項工作,因為這正是廣東話令大部份供應商提供的工具失效的環節——如果第一步已把字詞聽錯,之後的所有步驟都會出錯。

而這裏有個關鍵點,決定了整個問題的性質:幾乎所有語音 AI 都是先為英語而建的。廣東話被視為事後的翻譯附加物,被硬生生地加在一個從未為該語言實際行為方式而設計的系統之上。這與 從一開始就為香港從頭構建、以方言為本位的語音 AI,是截然不同的兩回事。

第一步:將聲音轉化為文字

「聆聽」的技術名稱是自動語音識別,簡稱 ASR。簡單來說,就是將聲音轉化為書面文字的工作。

以下是大概的運作原理(略去數學細節):

系統接收傳入的聲音,將其切割成極小的片段,每秒數千個。它檢查每個片段,問:「這是哪個基本語音?」——例如 k 音、aa 音等等。這些基本構件稱為音素。將音素串聯起來,便得到可能的音節,然後是可能的詞語。

但聲音是混亂的。許多詞語聽起來幾乎一樣,人們說話時會含糊不清,線路也有噪音。因此,系統不會逐個挑選詞語,而是同時考慮多個可能的句子,然後問:「這些當中,哪一個是真人最有可能會說的?」它運用對該語言的知識來排序,然後輸出最佳猜測作為文字。

最後這一步——選出最可能的完整句子——正是系統對特定語言的理解能力真正發揮作用的地方。熟悉英語的模型會傾向於合理的英語句子。不真正了解廣東話的模型則會一直猜錯,因為它不知道自然的廣東話句子應該是怎樣的。

圖表:語音 AI 將廣東話語音轉化為文字的過程——聲波、拆解為聲音、匹配詞語、選出最可能的句子、最終文字。

到目前為止,這對任何語言來說都是相同的挑戰。接下來是令廣東話特別困難的四個因素。

聲調問題:音高改變整個意思

這是最大的難題。在英語中,提高或降低音高會改變語氣——你會聽起來興奮、沉悶,或像是在提問。但詞語本身不變。「Cat」無論你說得高或低,仍然是「cat」。

廣東話並非如此。音高是詞語本身的一部份。同一個音節,以不同音高說出,就是意思完全不同的另一個詞語。廣東話有六個常用聲調(有些分析計至九個)。以下是經典例子——同一個音節「si」,配合不同聲調:

羅馬拼音聲調字詞意思
si1高平poem
si2高升history
si3中平to try
si4低降time
si5低升market
si6低平to be / yes

同樣的字母,六個不同的字詞。只有音高能區分它們。

現在想想這對以英語為先的系統意味着甚麼。它被設計為將音高視為情緒而非意義——因此它會丟棄該資訊,或錯誤解讀它。聲調聽錯,你得到的不是稍為不準確的答案,而是完全不同的字詞。在物業來電中,這意味着來電者報告的是 4 樓(四,sei3)還是 10 樓(十,sap6)的差別,或者是「試」與「時」的分別。聲調錯誤不是輕微的準確度下降,而是以十足信心派出了錯誤的行動。

羅馬拼音問題:沒有單一的「正確」拼寫

對英語而言,有一條清晰的鏈條:聲音 → 標準拼寫 → 意思。每個詞語都有一個公認的拼寫,因此系統一旦聽到它,便知道如何書寫及查閱。

廣東話沒有這條清晰的鏈條。它主要是一種口語——香港人閱讀及書寫標準中文字,但沒有一套普遍使用、統一的系統來以拼音方式拼寫廣東話。市場上有多套互相競爭的羅馬拼音方案:Jyutping(現代學術標準)、Yale(常見於較舊的教科書),以及大量人們隨意發明的、即興的非正式拼寫,尤其在網上。

這對 AI 為何重要?因為那條整齊的「聲音 → 標準拼寫 → 意思」捷徑並不存在。系統不能假設有一個正確的書寫形式作為錨點。它必須被訓練以應對同一口語詞語可能以幾種不同方式被表達的事實——而且大部份時候,「答案」本身就是中文字,而非羅馬拼音字符串。這是在聲調之上再疊加的一層模糊性。

中英夾雜問題:一句話、三種語言

聽聽香港人的實際說話方式,你會聽到類似這樣的內容:

「個 lift 壞咗呀,唔該 call 師傅上嚟 fix 啊,urgent 㗎。」

這是一句話中交織廣東話、英語及香港日常說話的節奏——而沒有人會覺得有問題。即使混入一兩個普通話詞語,仍然完全正常。這稱為中英夾雜(code-switching),在香港這不是例外,而是常態。

對語音 AI 而言,如果系統是圍繞單一語言而建的,這便是一場噩夢。只懂廣東話的模型會被英語卡住;只懂英語的模型則會被其他語言卡住。即使偵測到語言轉換——在句子中間注意到語言剛剛改變了——本身已經很困難。系統必須從設計上就是三語並重的,預期這種混合並從容應對,而非將每種語言視為需要切換的獨立模式。

這正是為何許多日常來電會令通用工具失效:AI 需要處理的常見物業來電,充滿了這種自然的語言混合,而非工整的書面句子。

數據問題:為何廣東話 AI 可學習的素材較少

AI 從例子中學習。它見過的某種語言例子越多——而且這些例子越符合實際使用情況——它的表現就越好。這正是廣東話處於結構性劣勢的地方。

世界上有大量的英語文本及英語音頻,全部經過整齊的轉錄並可用於訓練。廣東話的數量則少得多。而且差距比表面上更嚴重,因為確實存在的廣東話素材往往是正式或書面的,而物業來電中重要的語言恰好相反:口語化、快速、口頭、充滿俚語,並經由電話線路錄製。這類素材相對非常少。

因此,當通用模型在廣東話表現不佳時,通常不是一個謎——它只是沒有聽過足夠多的真實、口語、混亂的廣東話,來知道它應該聽起來是怎樣的。這就是為何本地化專精不是市場營銷口號,而是實際的運作機制。一個在真實香港來電上訓練的系統,已經從它將在生產環境中遇到的確切語言類型中學習。一個被翻譯成廣東話的通用模型則沒有。

現實世界的問題:噪音、電話及人們的實際說話方式

以上所有假設都基於清晰的錄音。真實的來電絕非如此。

物業熱線會接到來自當風平台、嘈雜大堂、旁邊建築地盤、或僅有一格信號的手機的來電。來電者可能是長者、情緒激動、說話速度快,或三者兼備。他們會打斷自己、聲音漸弱、重複說話。電話音頻本來就是狹窄且經壓縮的,會去除系統本可使用的細節。

在安靜的實驗室中理解廣東話,是一個已解決得足夠好的問題。在凌晨 2 點經由大堂對講機,理解一位焦慮住戶的廣東話,則是完全不同的標準——而且這是營運上唯一重要的標準。一個未經真實電話條件強化訓練的系統,會在示範時看起來令人印象深刻,然後在實際場地中崩潰——這是 來電接通後來電處理失敗 的其中一個較少被提及的原因。

Routiq AI 的廣東話語音 AI 正是為這些條件而建——包括聲調、中英夾雜及大堂噪音。

那麼,專為廣東話而建的語音 AI 如何解決這些問題?

將四個問題綜合起來,要求幾乎不言自明。一個真正理解香港廣東話的語音 AI 必須具備以下條件:

  • 以真實廣東話語音訓練,而非從英語系統翻譯而來——因此它確實聽過它需要識別的口語化、口頭語言。
  • 具聲調感知能力,將音高視為詞語的一部份而非情緒——因此它不會混淆「四」與「十」,或「詩」與「市」。
  • 從設計上就是三語並重的,預期在同一句子中出現廣東話、英語及普通話——因此中英夾雜是正常輸入,而非錯誤。
  • 針對電話音頻進行調校,強化應對噪音、弱信號及快速、非正式語音的能力——因此實驗室的準確度能經得起真實大堂的考驗。

然後還有超越語音識別的一點:它必須與行動連接。正確地聽到字詞只是第一步;當系統將「天台漏水」轉化為一個已記錄、已分類、可派工的工作時,價值才真正體現。單靠轉錄改變不了甚麼—— 將來電轉化為工單,才是工作量真正減少的關鍵。

這就是為何廣東話 AI 客服中心與一個貼上廣東話標籤的通用語音機械人是完全不同的產品類別。方言不是一個設定選項,而是基礎。

這對香港物業團隊意味着甚麼

如果你的來電者在錄音室中說着教科書式的普通話,幾乎任何語音 AI 都能勝任。但他們不會這樣做。他們說的是真實的香港廣東話——有聲調、中英夾雜、語速快、來自嘈雜的走廊——而這正是區分一個為該方言而建的系統與一個被翻譯成該方言的系統的關鍵輸入。

因此,實際的結論很簡單:不要以是否「支援廣東話」來評估語音 AI——每間供應商都會這樣聲稱。要以它是否為廣東話而建來評估——以真實語音訓練、具聲調感知能力、三語並重、並為電話環境強化。這就是一個令人印象深刻的示範與一個你在凌晨 2 點可以真正信賴的熱線之間的分別。

常見問題

AI 真的能理解廣東話嗎?

可以——但很大程度上取決於系統。專為廣東話而建、並以真實口語廣東話訓練的語音 AI,能夠良好地理解廣東話。通用的、以英語為先的語音 AI 則往往表現欠佳,尤其在聲調及香港說話中自然的語言混合方面。

為甚麼廣東話對 AI 來說比英語或普通話更困難?

四個因素疊加:廣東話使用聲調,音高改變字詞的意思;它沒有統一的標準拼音方式;香港說話者經常將廣東話與英語及普通話混合;可用於訓練的口語廣東話數據遠比英語少。每個因素都增加了系統需要解決的模糊性。

甚麼是 Jyutping?AI 需要它嗎?

Jyutping 是以拉丁字母書寫廣東話發音的現代標準系統,主要用於教學及研究。日常用戶無需認識它——一個設計良好的系統能在來電者完全無需接觸羅馬拼音的情況下處理廣東話。它在幕後重要,並非在通話中。

廣東話語音 AI 能在同一通來電中處理英語及普通話嗎?

可以——如果它從設計上就是三語並重的。由於香港來電者經常在同一句子中切換三種語言,一個具備能力的系統預期這種混合並從容應對,而非將每種語言視為獨立模式。

背景噪音會影響廣東話語音識別嗎?

影響很大。真實來電伴隨大堂噪音、風聲、微弱的手機信號及壓縮的電話音頻,所有這些都令識別更困難。未經真實電話條件特別調校的系統,在實際場地中的表現往往遠遜於安靜的示範環境。

廣東話聊天機械人與廣東話語音 AI 是否相同?

不相同。聊天機械人處理輸入的文字,通常用於簡單的常見問題;而語音 AI 處理即時口語來電——這正是聲調、中英夾雜及噪音全部發揮作用的場景。緊急物業問題是以電話而非文字訊息的形式出現,這就是為何以語音為先的廣東話 AI 比聊天機械人更為重要。

作者: Palette Space Limited 人工智能研究與編輯團隊
審閱: 梁家傑 Julius Leung,Palette Space Limited 創辦人兼行政總裁
立即開始

親身體驗 Routiq AI

立即試用,直接與 Routiq AI 對話;或預約示範,由我們即場為你講解。