# supertonic-express 第 6 期 · Lucy 交付素材包 v1(供 eleven / Builder阿码 对盘) > 口径基准(v1):共享素材 = 我亲测产出的 4 条 WAV(en / en-自然文本 / ko / es,均 15 步推理)。 > 所有数字以《文案_终稿.md》与 `test/out/run_log_15step.json` 为准。 > **⚠ 口径待 chair 裁定**:派工单要求"中文+至少 1 门外语",实测 Supertonic 2 不支持中文(报错原文 `Language 'zh' not supported. Choose from: en, ko, es, pt, fr`)。 > 文案已按实测事实表述为「5 种语言(en/ko/es/pt/fr,无中文)」;若 chair 裁定需调整表述,我再改终稿并同步 APP.md 素材。 ## 〇、共享素材 sha256(多人共用同一版本) | 文件 | sha256 | 说明 | |---|---|---| | test/out/en_s15.wav | 4b6bb655ab44fe0b4f2212f02cfb8c2d0505541331149f9d2c23db9470838677 | 英语 M1,77 字符,6.97s | | test/out/en-natural_s15.wav | cf84be0f6ab647f9be933454b6f1757a8d0b27cf3083333764ee3cbde7b10e4c | 英语自然文本($5.2M/4:45 PM/Wed, Apr 3),86 字符,9.61s | | test/out/ko_s15.wav | b77b7f842f950772bd4bbc81411c2a0a252ce26b3da449705dac45db883754c5 | 韩语 F1,35 字符,5.85s | | test/out/es_s15.wav | be9549251c7a52d70451a2151b495473c4b027523da128bce03cbc23fad381c8 | 西语 M1,73 字符,6.20s | | test/out/run_log_15step.json | b8343aa419e603eb8945796337d01dd0ff8c88c3290fb179bf6ba580cb7366ee | 15 步亲测原始日志 | | test/out/run_log_5step.json | 8e88f07344d88ba6c2c1f8631aeb755af7699d8df673b2f7f33a1208938c039a | 5 步对照日志 | | 文案_终稿.md | 3fa5b749493448768060176ea56e9156d76cfe977b1cadd255307a046a71de7a | 终稿(humanizer-zh 已过) | | 文案_初稿.md | 93ff6880e5651ea2510d0528fadb02fa7fd511646877e9f84e1b59ee195eb30c | 初稿(留档对照) | 素材路径:`/Users/tusm/idbots/project/bots/21/2026-08-22/test/out/` ## 一、配图 prompt(3 张,供 eleven 制作) **图1 cover.png(封面卡)** - 主标:`Supertonic Express 亲测` - 副标:`本地多语言 TTS · 零 API Key` - 主数字区:`3 种语言跑通` / `RTF 0.23 最快`(副行:`15 步推理 · M1 Pro`) - 底部:`一天一个新 Skill · 第 6 期` / `2026-08-22` / `github.com/groxaxo/supertonic-express`(纯文本,勿做链接样式) - 视觉:深色底 + 声波图形 + 语言标签 `en ko es pt fr`(中文不在列,可放一个灰色 `zh 暂不支持` 小标签,呼应文案边界) **图2 how-it-works.png(原理/管线示意图)** - 管线:`文本 → [ONNX 本地推理] → WAV 44.1kHz` - 标注:模型 `263MB` · `66M 参数` · 音色 `M1/F1` - 语言区:`en ko es pt fr` 5 个标签 + 一个划线的 `zh`(暂不支持) - 命令示例(真实命令,两行): - `git clone https://github.com/groxaxo/supertonic-express.git` - `cd js && npm install` - footer:`首次运行自动下载模型 ~263MB · 二次启动加载约 1s` **图3 metrics.png(量化数据图)** - 主对比:4 条实测语音(en / en-自然文本 / ko / es)的生成耗时 vs 输出时长 - en:3.27s → 6.97s 音频 - en-自然文本:2.19s → 9.61s 音频(含 $5.2M / 4:45 PM / Wed, Apr 3) - ko:1.48s → 5.85s 音频 - es:1.58s → 6.20s 音频 - 副指标:RTF 0.23~0.47(15 步实测);首次下载模型 297s,二次加载 1s - 底部小字:`实测:M1 Pro / Node 26 / 15 步推理;未做 ASR 回读验证;输出 pcm_f32le` ## 二、视频脚本(带字幕,供 eleven;总长约 30~35s) 1. **片头卡(2s)**:`Supertonic Express · 亲测手记` / `第 6 期` 2. **终端镜头(~6s)**:跑 `npm install` 与生成脚本,字幕显示真实命令: - `git clone ... && cd js && npm install` - `node run_tts.mjs` → 字幕 `首次下载模型 ~263MB(实测 297s)· 二次加载 1s` 3. **多语言演示(~15s)**:依次播放 3 条 WAV(en → ko → es),画面为声波+语种标签,字幕=音频原文: - en:`Hello! Welcome to Supertonic, on-device text to speech. No cloud, no API key.` - ko:`안녕하세요! 슈퍼토닉은 기기에서 바로 실행되는 음성 합성입니다.` - es:`¡Hola! Bienvenido a Supertonic, síntesis de voz en tu propio dispositivo.` 4. **数据卡(~8s)**:`RTF 0.23~0.47 · 约 2~4 倍实时`;大字提醒 `暂不支持中文(en/ko/es/pt/fr)` 5. **片尾卡(2s)**:`github.com/groxaxo/supertonic-express`(纯文本)· `零 API Key · 本地运行` 音频素材直接用共享 WAV(en_s15 / ko_s15 / es_s15),与文案数字完全同源。 ## 三、APP.md 素材(供 Builder阿码 组装;GitHub 一律纯文本) ```markdown # supertonic-express(端侧 ONNX 多语言 TTS) 开源端侧 TTS:ONNX Runtime 本地推理,零 API Key、零网络依赖,官方支持 en/ko/es/pt/fr 五种语言(暂不支持中文)。 仓库 github.com/groxaxo/supertonic-express(MIT License,新仓库)| 模型 onnx-community/Supertonic-TTS-2-ONNX(66M 参数,约 263MB)| Node >= 18 或 Python 3.10+ ## 安装(JS 路径实测通过) 1. git clone https://github.com/groxaxo/supertonic-express.git 2. cd js && npm install 3. 首次运行自动下载模型(实测 297s 含下载+加载);二次启动加载约 1s 实测环境:macOS 26.5.2 / Apple M1 Pro / Node v26.7.0 ## 用法(最小示例) import { SupertonicTTS } from './index.js'; const tts = new SupertonicTTS(); await tts.initialize(); await tts.generateAndSave('Hello world!', 'out.wav', { language: 'en', // en/ko/es/pt/fr speaker_embeddings: 'https://huggingface.co/onnx-community/Supertonic-TTS-2-ONNX/resolve/main/voices/M1.bin', num_inference_steps: 15, speed: 1.0, }); 支持音色:M1~M5(男)、F1~F5(女)。 注意:language 传 zh 会报错 `Language 'zh' not supported. Choose from: en, ko, es, pt, fr`。 ## 实测数据(2026-08-22,15 步推理,M1 Pro) | 文本 | 语言 | 生成耗时 | 输出时长 | RTF | 文件 | |---|---|---|---|---|---| | Hello! Welcome to Supertonic... | en | 3.27s | 6.97s | 0.47 | en_s15.wav | | The startup secured $5.2M... Wed, Apr 3. | en | 2.19s | 9.61s | 0.23 | en-natural_s15.wav | | 안녕하세요! ... | ko | 1.48s | 5.85s | 0.25 | ko_s15.wav | | ¡Hola! Bienvenido ... | es | 1.58s | 6.20s | 0.26 | es_s15.wav | - 输出:44.1kHz 单声道 WAV,实际为 pcm_f32le(README 写 16-bit,以实测为准);1 秒音频约 176KB - 自然文本($5.2M / 4:45 PM / Wed, Apr 3)无需预处理直接生成成功;发音准确率未做 ASR 回读验证(本机无 ASR 环境) - 每进程首个生成调用偏慢(预热),之后稳定 1.5~2s;15 步 vs 5 步无稳定提速差异 ## 边界 - 暂不支持中文(官方 5 语言:en/ko/es/pt/fr) - 首次需下载约 263MB 模型;需能访问 Hugging Face - 实测平台 macOS arm64(M1 Pro);官方性能口径(i7-4790 9.774x / M4 Pro 167x)为 README 数据,未在本机复现 ``` ## 四、口径核对清单(发布前自查) - [ ] 语言口径统一:`en/ko/es/pt/fr,暂不支持中文`——cover 图、管线图、metrics 图、视频字幕、文案、APP.md 全部一致 - [ ] 主口径 = 实测(15 步 / M1 Pro / RTF 0.23~0.47);官方 README 数字(9.774x / 167x)只标注为官方口径 - [ ] 输出格式口径:pcm_f32le(README 16-bit 以实测为准),1s ≈ 176KB - [ ] 速度结论:约 2~4 倍实时;不写"5 步更快"(实测无稳定差异) - [ ] GitHub/官网一律纯文本,无 Web2 可点击链接 - [ ] 上链前等 chair 裁定本包口径(尤其"不支持中文"表述)