自訂模型 Pro
Pro 訂閱者可以匯入自己的語音轉文字模型,取代 Echophrase 內建模型庫中的模型。 此功能適合進階使用者,例如想使用特定微調模型、小眾語言模型,或是尚未收錄於 內建模型庫中的模型。什麼是 ONNX 模型?
ONNX(Open Neural Network Exchange)是一種開放、可攜的機器 學習模型檔案格式,讓在某個框架訓練的模型能在不同的執行環境中運作 - 在此指的 是 ONNX Runtime,也就是 Echophrase 內建模型所使用的執行引擎。 ONNX 格式的語音轉文字模型通常包含以下檔案:model.onnx- 模型本身(必要)model.onnx.data- 較大模型的外部權重檔(選用,僅在模型以此方式匯出時 才會出現)tokenizer.json與/或config.json- 描述如何將模型的原始輸出轉換 為文字的檔案(選用,但建議提供 - 若缺少,應用程式會退回盡力解碼)
從哪裡尋找模型
- Hugging Face 模型庫
- 已篩選為 ONNX 格式的自動語音辨識模型,是最容易瀏覽的來源。
- ONNX Model Zoo - 由 ONNX 社群維護的 預訓練 ONNX 模型精選集。
.onnx 檔案(最好也附有 tokenizer.json)且專為自動語音辨識設計
的儲存庫或下載項目。
如何匯入模型
開啟設定 > 自訂模型,選擇以下其中一種方式匯入模型:本機檔案
瀏覽選擇磁碟上的
.onnx 檔案,或直接拖放至設定視窗中。若模型附有
.onnx.data 權重檔、tokenizer.json 或 config.json,請一併加入
(或直接拖放整個資料夾)。Hugging Face 儲存庫
貼上儲存庫網址或
org/repo 名稱,例如 openai/whisper-tiny.en。
Echophrase 會直接下載該儲存庫的檔案。該儲存庫必須恰好包含一個
.onnx 檔案 - 若有多個,請手動下載您想要的檔案並改用本機檔案方式匯入。在 WSL 上,Windows 檔案總管無法將檔案拖曳進 WSL 視窗,因此匯入視窗會顯示
瀏覽按鈕,而不是拖放區。
自訂模型有 8 GB 的大小限制。
相容性規範
由於 Echophrase 無法預先得知每個可能模型的架構,因此所有自訂模型都會透過 單一通用推論流程執行。模型若要產生可用的轉錄結果,必須:- 接受原始 16 kHz 單聲道波形作為輸入
- 以張量名稱
audio/input/mel公開該輸入 - 產生 Echophrase 可解碼為文字的文字或詞元輸出
即將推出:轉換模型
第二個自訂模型欄位 - 供**轉換(Transform)**模型使用,用於後製處理轉錄文字 (文法修正、自訂改寫規則等)- 規劃於未來版本推出。目前尚不支援自訂轉換模型; 內建版本請參閱轉換模型。安全性須知
自訂模型完全在您的裝置上透過 ONNX Runtime 執行,與 Echophrase 內建模型 使用的引擎相同 - 自訂模型的任何內容都不會上傳或傳送至 Echophrase 的伺服器。 儘管如此,請留意以下幾點:- 僅匯入您信任的模型。
.onnx檔案本質上是一個運算圖,即使 Echophrase 已驗證其能在 ONNX Runtime 中成功載入,惡意或有問題的檔案仍可能在執行時 出現異常行為。 - 驗證僅確認格式,不代表品質。 Echophrase 只會檢查檔案是否為真實、可 載入的 ONNX 模型 - 無法驗證該模型的訓練資料、準確度,或其輸出是否可信。
- 優先選擇可靠來源。 具有明確作者、說明與下載次數的 Hugging Face 儲存庫, 通常比來路不明的連結或檔案更值得信賴。