# faster-whisper 实测数据(可复算) ## 环境 - 机型:Apple M4(arm64) - Python:3.9.6 - faster-whisper:1.2.1 / ctranslate2:4.7.2 - ffmpeg:N-124568(tessus 构建) - 测试音频:`assets/ref_zh_16k.wav`(中文 TTS,Ting-Ting 声音,时长 28.49s,16kHz 单声道) ## 参考原文(Ground Truth) > 大家好,今天我们来聊一聊人工智能。人工智能这个词听起来很高级,其实它就在我们身边。手机里的语音助手,推荐系统,还有自动驾驶,都用到了人工智能技术。过去的几年,中国在人工智能领域发展得非常快,许多公司都在研发自己的大模型。我们相信,未来人工智能会像水和电一样,成为我们生活中不可或缺的一部分。 ## 实测结果 ### base 模型(device=cpu, compute=int8, beam_size=5) - 模型加载耗时:**0.95s**(已缓存;首载含下载更久) - 转写耗时:**1.39s**(28.49s 音频) - 识别语言:zh(prob 1.00) - 转写结果(逐字比对): > 大家好,今天我們來聊一聊人工智能,人工智能這個詞聽起來很高級,其實他就在我們身邊,手機裡的語音助手,推薦系統,還有自動駕駛,都用到了人工智能技術,過去的幾年,中國在人工智能領域發展的非常快,許多公司都在研發自己的大模型,我們相信,未來人工智能會像水和電一樣,成為我們生活中不可獲缺的一部分。 与原文语义完全一致(body 文本逐字正确,仅输出为繁体/标点为半角,属 TTS 语音特征,不影响正确性)。1 处可议:末句「不可或缺」识别为「不可獲缺」,「或」→「獲」为同音误识。 ### tiny 模型(device=cpu, compute=int8, beam_size=5) - 模型加载耗时:**15.24s**(含首次下载模型) - 转写耗时:**0.87s** - 识别语言:zh(prob 1.00) - 转写结果(逐字比对): > 大家好,今天我們來聊一聊人工智能,人工智能這個詞聽起來很高級,其實他就在我們身邊,手機裡的語音助手,推薦系統,還有自動駕駛,都用到了人工智能技術,過去的幾年,中國在人工智能領域發展的非常快,許多公司都在研發自己的大模型,我們相信,未來人工智能會向水和電影一樣,成為我們生活中不可獲缺的一部分。 与原文差异 2 处:「像水和电」→「向水和电影」、「不可或缺」→「不可獲缺」。 ### small 模型(device=cpu, compute=int8, beam_size=5) - 模型加载耗时:**1.42s** - 转写耗时:**3.72s**(三档里最准) - 识别语言:zh(prob 1.00) - 转写结果(逐字比对): > 大家好,今天我们来聊一聊人工智能。人工智能这个词听起来很高级,其实它就在我们身边,手机里的语音助手,推荐系统,还有自动驾驶,都用到了人工智能技术。过去的几年,中国在人工智能领域发展的非常快,许多公司都在研发自己的大模型。我们相信,未来人工智能会像水和电一样,成为我们生活中不可或缺的一部分。 与原文比对:**简体字、标点全部正确,仅 1 处词形差异**(「发展得」→「发展的」,语义一致)。是三档里转写质量最高的。 ## 三档快速对照 | 模型 | 加载 | 转写(28.49s) | 错误数 | |------|------|-----------|-------| | tiny | 15.24s* | 0.87s | 2 处 | | base | 0.95s | 1.39s | 1 处 | | small | 1.42s | 3.72s | 0 处(仅词形差异) | > *tiny 首次运行含下载模型耗时;再次运行加载会显著变快。 ## 复算方法 - 安装:`pip install faster-whisper`(需 ffmpeg) - 转写:`python3 scripts/transcribe.py assets/ref_zh_16k.wav base --lang zh --json` - 模型首次运行自动下载,缓存于 `~/.cache/huggingface` ## 文件校验 - 技能包 zip 及 assets 的 MD5 见交付备注。