控制台
显示设置
验证样本信息
本地 Whisper 设置(国内/离线)
档位越高质量越好但更慢更大;large-v3 手机实时跑不动,仅桌面/强设备用。切换后「下次开始」生效。
留空即使用本站内置模型(vendor/whisper-model/,离线可用)。若本地缺少某档位,可填远程镜像(如 https://hf-mirror.com/ )按需拉取。
transformers.js 库地址。默认随站内置(../vendor/transformers.min.js,离线/国内可用);若文件缺失可改为 esm.sh 等可达 CDN(如 https://esm.sh/@xenova/transformers@2.17.2?bundle ),或改用「演示」模式。
填写后,「本地 Whisper」将跳过浏览器内 WASM 推理,直接把音频发到该后端地址(契约同「后端 API」:POST 16kHz WAV,返回
{"text":"..."})。页面不再卡死;留空则仍走本地模型。
后端若需鉴权则填写;留空则请求不带 Authorization 头。
攒够该时长音频即发一次后端推理。越小字幕出现越早,但请求更频繁;默认 2s(范围 1~6s)。想更快可试 1~1.5s。
后端 API 设置(本地服务 / 自训练模型)
把音频 POST 到后端推理服务,避免浏览器端卡顿。
本地后端 Whisper:填写
自训练模型:填写你自己的模型 API 地址。留空则后门关闭。
本地后端 Whisper:填写
http://localhost:8765/asr(需先启动 python3 whisper_server.py)自训练模型:填写你自己的模型 API 地址。留空则后门关闭。
可选鉴权;留空则请求不带 Authorization 头。
前后对照:「字幕:开」正常显示;切到「字幕:关」则只记录不显示,用于采集无字幕基线(PRD §1.4)。