自定义模型 Pro
Pro 订阅者可以导入自己的语音转文字模型,取代 Echophrase 内置模型库中的模型。 此功能适合高级用户,例如想使用特定微调模型、小众语言模型,或是尚未收录于 内置模型库中的模型。什么是 ONNX 模型?
ONNX(Open Neural Network Exchange)是一种开放、可携的机器 学习模型文件格式,让在某个框架训练的模型能在不同的运行环境中运作 - 在此指的 是 ONNX Runtime,也就是 Echophrase 内置模型所使用的运行引擎。 ONNX 格式的语音转文字模型通常包含以下文件:model.onnx- 模型本身(必要)model.onnx.data- 较大模型的外部权重档(选用,仅在模型以此方式导出时 才会出现)tokenizer.json与/或config.json- 描述如何将模型的原始输出转换 为文字的文件(选用,但建议提供 - 若缺少,应用程序会退回尽力解码)
从哪里寻找模型
- Hugging Face 模型库
- 已筛选为 ONNX 格式的自动语音识别模型,是最容易浏览的来源。
- ONNX Model Zoo - 由 ONNX 社区维护的 预训练 ONNX 模型精选集。
.onnx 文件(最好也附有 tokenizer.json)且专为自动语音识别设计
的保存库或下载项目。
如何导入模型
打开设置 > 自定义模型,选择以下其中一种方式导入模型:本机文件
浏览选择磁盘上的
.onnx 文件,或直接拖放至设置窗口中。若模型附有
.onnx.data 权重档、tokenizer.json 或 config.json,请一并加入
(或直接拖放整个文件夹)。Hugging Face 保存库
粘贴保存库网址或
org/repo 名称,例如 openai/whisper-tiny.en。
Echophrase 会直接下载该保存库的文件。该保存库必须恰好包含一个
.onnx 文件 - 若有多个,请手动下载您想要的文件并改用本机文件方式导入。在 WSL 上,Windows 文件总管无法将文件拖拽进 WSL 窗口,因此导入窗口会显示
浏览按钮,而不是拖放区。
自定义模型有 8 GB 的大小限制。
兼容性规范
由于 Echophrase 无法预先得知每个可能模型的架构,因此所有自定义模型都会通过 单一通用推理流程运行。模型若要产生可用的转录结果,必须:- 接受原始 16 kHz 单声道波形作为输入
- 以张量名称
audio/input/mel公开该输入 - 产生 Echophrase 可解码为文字的文字或词元输出
即将推出:转换模型
第二个自定义模型字段 - 供**转换(Transform)**模型使用,用于后制处理转录文字 (语法修正、自定义改写规则等)- 规划于未来版本推出。目前尚不支持自定义转换模型; 内置版本请参阅转换模型。安全性须知
自定义模型完全在您的设备上通过 ONNX Runtime 运行,与 Echophrase 内置模型 使用的引擎相同 - 自定义模型的任何内容都不会上传或发送至 Echophrase 的服务器。 尽管如此,请留意以下几点:- 仅导入您信任的模型。
.onnx文件本质上是一个运算图,即使 Echophrase 已验证其能在 ONNX Runtime 中成功加载,恶意或有问题的文件仍可能在运行时 出现异常行为。 - 验证仅确认格式,不代表质量。 Echophrase 只会检查文件是否为真实、可 加载的 ONNX 模型 - 无法验证该模型的训练数据、准确度,或其输出是否可信。
- 优先选择可靠来源。 具有明确作者、说明与下载次数的 Hugging Face 保存库, 通常比来路不明的链接或文件更值得信赖。