一天一个新 Skill · 第 6 期
文字进、WAV 出,模型全程跑在本地。这次不读 README 就下结论——直接 clone 下来跑了一遍。
给视频配音、做播客、读长文,绕不开文字转语音。以前的路子就两条:要么用云端 API,注册、充值、配 Key,还要担心文本内容被第三方看到;要么用本地 TTS,装完发现多半只支持一两种语言,或者音质像机器人。
Supertonic Express 走的是第三条路:模型完全跑在本地,ONNX Runtime 推理,官方说支持 5 种语言,宣称速度远超实时。这类"本地多语言 TTS"的仓库不少,但大多数不是模型太大,就是语言支持名不副实。所以这次直接 clone 下来跑一遍,用真实数字说话。
git clone https://github.com/groxaxo/supertonic-express.git
cd supertonic-express/js
npm install
本机环境:macOS 26.5.2 / Apple M1 Pro / Node v26.7.0。装完依赖后写了个十几行的调用脚本:初始化(首次运行会自动从 Hugging Face 下载模型,约 263MB,实测花了 297 秒,包含下载和加载;第二次运行只需要 1 秒)→ 逐条生成 WAV。
统一用 15 步推理(仓库示例默认参数),每个文本单独计时。输出是 44.1kHz 单声道 WAV,用 ffprobe 核对时长、用 volumedetect 确认不是静音文件(各条 mean -25~-28dB、峰值 -7~-9dB,正常语音响度)。
| 文本 | 语言 | 音色 | 字符数 | 生成耗时 | 输出时长 | RTF* | 文件大小 |
|---|---|---|---|---|---|---|---|
| Hello! Welcome to Supertonic, on-device text to speech. No cloud, no API key. | en | M1(男) | 77 | 3.27s | 6.97s | 0.47 | 1.23MB |
| The startup secured $5.2M in funding, and the meeting starts at 4:45 PM on Wed, Apr 3. | en | M1(男) | 86 | 2.19s | 9.61s | 0.23 | 1.70MB |
| 안녕하세요! 슈퍼토닉은 기기에서 바로 실행되는 음성 합성입니다. | ko | F1(女) | 35 | 1.48s | 5.85s | 0.25 | 1.03MB |
| ¡Hola! Bienvenido a Supertonic, síntesis de voz en tu propio dispositivo. | es | M1(男) | 73 | 1.58s | 6.20s | 0.26 | 1.09MB |
* RTF = 生成耗时 ÷ 输出时长,越小越快;RTF 0.23 表示生成 1 秒音频只需 0.23 秒。
几条实测结论:
Language 'zh' not supported. Choose from: en, ko, es, pt, fr派工单上写的是"中文 + 至少一门外语",但实测下来:Supertonic 2 的 5 种语言里没有中文。拿"你好,这是中文语音合成测试。"直接跑,得到上面的报错。这是当前最大的短板。要做中文配音,得绕道:要么等官方支持,要么换方案(比如 Kokoro 支持中文,或者云端 edge-tts)。把事实如实摆在前面,免得有人装完才发现。
| 方案 | 是否纯本地 | 要 API Key 吗 | 语言覆盖 | 速度(RTF,越低越快) |
|---|---|---|---|---|
| Supertonic Express(本次实测) | 是 | 否 | en/ko/es/pt/fr(无中文) | 0.23~0.47(15 步,M1 Pro 实测) |
| edge-tts | 否(微软在线) | 否(但要联网) | 多语言含中文 | 依赖网络,未实测 |
| Kokoro | 是 | 否 | 多语言含中文 | 0.144(官方口径,M4 Pro) |
| Piper | 是 | 否 | 多语言,每语种一个模型 | 官方宣称可实时,音质一般 |
| ElevenLabs / OpenAI TTS | 否(云端 API) | 是(要钱) | 多语言强 | 官方口径 0.06~0.20 |
三语演示(en → ko → es),音频与上方表格同源(共享 WAV 直出),字幕烧进画面。
要本地、免 Key、多语言的 TTS,装一个跑跑不亏;要配中文,先等等,或者换方案。