一个 App,装下本地声音模型;
一张网页,先把它用起来。
OpenSound 桌面 App 把语音识别、文本朗读、本地对话、语音克隆做成本地点开即用,隐私不出本机;同时是开放端口后端(127.0.0.1:9528),供浏览器、网站、脚本接入。本站是它的零安装网页版——打开就能用「设备 + 云端 + 浏览器端侧模型」能力。
设备声音
浏览器系统音色 + 系统识别,零安装、免下载,默认秒开。
云端 API
高音质 / 多方言 / 克隆走云端,自填 Key 直连或轻代理免费档。
端侧小模型
kokoro 中英混读、SenseVoice 识别、WebLLM 对话——浏览器里下载一次后离线可用。
本机 App 引擎
网页连上正在运行的 App(9528),临时解锁全部本地大模型引擎。
能力跟着「声音来源」走,网页先行、App 升级
同一个 OpenSound:装得越多,解锁越多。无论从哪进来,交互语言和云端供应商是同一套。
只开网页零安装
本站工作台默认用设备能力(系统音色 / 系统识别),填了云端 Key 或下载端侧小模型后可更强。
安装 App全能力主场
本地部署 SenseVoice / Whisper / CosyVoice / Qwen3 等大模型,断网也能识别、朗读、对话、克隆。
网页 + App 同开最强档
网页自动探测本机 9528,经一次性授权握手接入 App 全部引擎(仅本机浏览器可连,天然安全)。
不装 App,本站自己也能出声出字
每个能力都是一个独立页面,引擎档位在界面上标清楚:设备(默认)/ 端侧(需下载)/ 云端(出网)/ 本机 App。其中朗读页的「设备系统声 / 微软在线声」两档已可试听,其余为骨架预览、按阶段接入。
语音识别
说话或上传音频 → 出文本。设备 Web Speech 打底,端侧 SenseVoice 离线大段转写,云端覆盖方言。
文本朗读
粘贴文本 → 出声。系统声、Edge 微软在线声、端侧 kokoro(中英混读)均已可用;云端后续接入。
语音对话
文字 / 语音提问,云端 LLM 回答,回答可朗读。WebGPU 桌面浏览器可切端侧小模型。
环境音素材库
雨声、海浪、白噪音多轨混音,直接当背景声播放。复用 backhill R2 素材目录,免 Key。
音频编辑
音量、剪切拼接、淡入淡出,波形选区 + 试听 + 导出 WAV / M4A。纯浏览器本地处理,不下载模型、不出网。
语音克隆
浏览器端侧没有成熟克隆方案,留给云端或 App。需本人声音授权,官网仅做入口引导。
App 与网页版,各做各强的部分
上排为能力,对应到 App / 网页的实现方式。同一套云端供应商与交互语言,差异只在“在哪里算”。
| 能力 | OpenSound App(全能力) | 网页版 · 本站 |
|---|---|---|
| 识别 ASR | 本地 SenseVoice / Whisper + 系统识别 + 云端 | 设备 Web Speech(Edge / Safari)→ 端侧 SenseVoice → 云端 |
| 朗读 TTS | 本地三引擎 + 系统音色 + 云端 | 设备系统声(Edge 含微软在线)→ 端侧 kokoro(中英混读)→ 云端 |
| 对话 LLM | 本地 llama / Ollama + 云端 DeepSeek / 智谱 | 云端(默认)→ 端侧 WebLLM(WebGPU 桌面) |
| 语音克隆 | 本地 CosyVoice3 + 云端克隆 | 仅云端 · 规划中(需本人声音授权) |
| 实时语音 | 本地低延迟实时链路 | 降级:麦克风 + 云端 ASR/TTS 串联 |
| 环境音素材库 | App 内规划中 | 网页直接可用(backhill R2 多轨混音)· 规划中 |
| 音频编辑 | App 内规划中(与网页同一套清单) | WebAudio 轻量版 · v1 可用(音量 / 剪切拼接 / 淡入淡出 / 导出 WAV · M4A;变速待下一阶段) |
| 人声伴奏分离 | App 内规划中 | 不做(模型过重,引导下载 App) |
把全能力带回本机
模型权重与受管环境放在下载目录的数据根,升级 App 不影响模型;官方源 + 镜像自动切换。
Windows · x64
主推 Windows 11(Win10 已停止支持,尽力兼容)
安装包发布后在此提供 · 先看使用说明
macOS · Apple 芯片
Apple silicon + macOS 14+
从零验收进行中 · 安装包发布后在此提供
零安装 · 打开即用
无需下载,任何浏览器
本站工作台:设备 + 云端 + 端侧小模型
装好后,三步上手
- 1按顶部引导条点「安装 Node」(只需一次);要用 Qwen3 / SenseVoice / CosyVoice 时再点「安装 Python 基础」。
- 2模型管理页逐个下载引擎 —— 权重放数据根目录,官方源 / 镜像自动切换,断点续传。
- 3识别 / 朗读 / 对话 / 克隆即可用;其它 App、网站、脚本接 http://127.0.0.1:9528。
语音识别
说话或上传音频,出文本。默认走设备系统识别;要离线大段转写或方言,切端侧 / 云端。
手机端注意
- 录音必须由一次用户点按触发授权;iOS Safari 尤其如此,否则不会开始采集。
- 识别结果可手动修正后再复制或导出。
与 App 的差别
- App 本地识别更稳、支持长音频与流式;网页端适合短时与体验。
- 端侧 SenseVoice 档现在也能转写音频文件(切到该档 → 选文件);设备档仍只认麦克风。
模型与许可(署名)
- 端侧识别使用 SenseVoiceSmall 模型,作者 FunASR / FunAudioLLM(阿里通义实验室),依据 FunASR Model Open Source License Agreement v1.1 使用,经 sherpa-onnx(Apache-2.0)转为 ONNX 在本机浏览器推理。
- 模型卡 huggingface.co/FunAudioLLM/SenseVoiceSmall · 许可 MODEL_LICENSE v1.1(非 OSI 认证;要求注明出处、作者并保留模型名)。
- 本项目使用官方血统的
2024-07-17版权重,且下载地址钉在固定 revision;模型由你的浏览器直接从 Hugging Face 下载并缓存在本机,音频与文本都不上传。 - 长音频切段使用 Silero VAD(MIT,取自官方 VAD Space)。
文本朗读
粘贴文本即出声。默认用系统音色秒开;Edge 额外列出微软在线声;想要更自然的音色再切端侧或云端。
音素 / 声调(高级 · 可编辑)
1–5 是声调(5 = 轻声),
/ 是词间停顿。多音字念错或声调不对时,直接改这里再点「朗读」即可——
改动后整句按你给的音素合成(中英混读与自动分词在此模式下失效,是刻意的)。
音色说明
- 「本地系统声」离线免费;名字带 Online (Natural) 的微软声需联网、且只有 Edge 暴露。
- 浏览器音色是延迟加载的,本页会在就绪后自动刷新下拉框与状态卡。
与 App 的差别
- App 含本地三引擎 + 克隆音色与朗读历史库。
- 云端档需要先在设置里填供应商 Key(只存本机)。
语音对话
打字或说话提问,回答可再朗读出来。默认走云端 LLM;支持 WebGPU 的桌面浏览器可换端侧小模型。
对话面板
这里将提供多轮对话窗口、语音提问按钮、回答朗读开关,以及「边说边答」的降级实时模式。
实时语音
- 网页版为降级实时:麦克风 + 云端 ASR/TTS 串联,非低延迟流式。
- 要真正的低延迟实时对话,请在 App 内使用。
Key 与隐私
- 对话内容会发给所选云端供应商,界面明确标注「出网」。
- Key 只存在本机浏览器,官网不碰你的额度与账单。
环境音素材库
雨声、海浪、白噪音……多轨叠加成一段背景声。素材来自 backhill R2 目录,免 Key、可直接播放混音。
素材分类 + 混音面板
这里将提供素材分类浏览、试听、多轨叠加(Howler 播放)与音量平衡,混好的组合可一键导出。
素材来源
- 目录 JSON + 音频直链由 backhill R2 提供(whitenoise.earthtrip.online)。
- 分类、命名与时长以素材库实际数据为准。
用途
- 直接当背景声播放,或导出后送进音频编辑进一步处理。
- 此能力 App 内同步规划中,两端清单一致。
音频编辑 v1 · 可用
纯浏览器本地处理:导入音频(本地文件 / 视频提音轨 / 播客链接)→ 波形与选区 → 音量 / 剪切 / 拼接 / 淡入淡出 → 试听 → 导出。不下载任何模型、不需要后端。
导入音频 / 视频
支持浏览器能解码的格式(wav / mp3 / m4a / flac 一般都可以)。Safari 不支持 ogg / opus——解不开时会明确报错,不会假装支持。 也可以直接选视频文件(mp4 / mov / webm):浏览器只取它的音轨,画面直接丢掉。 所有处理都在本机内存里对副本做,原始文件永不被改写,音频也不上传。
从链接导入 联网
粘 播客订阅链接(RSS) 可以列出单集挑一集;也可以直接粘 音频 / 视频直链(.mp3 / .m4a / .mp4 …)。 文件由对方服务器直接送到你的浏览器,本站没有任何中转服务器,也不保存任何东西。 ⚠️ 这条路径是出网的(与上面的「本地上传」不同),而且要求对方服务器允许浏览器跨域读取。
能力边界
- 轻量版 = 浏览器 WebAudio 本地处理,无需后端;也不需要下载任何模型。
- 出网标注(重要):本地上传(含视频提音轨)、朗读页传送、以及全部编辑与导出都不出网, 文件只在你本机内存里。只有「从链接导入」这一条是出网的——它是把你的浏览器直接连到对方的音频服务器,本站没有中转服务器。
- 视频:选一个 mp4 / mov / webm,浏览器只取音轨(画面丢掉);能取什么格式由浏览器决定,取不到会明确报错。
- 「从链接导入」能不能用取决于对方的跨域策略,不是我们说了算。多数播客托管允许(Megaphone / Simplecast / ART19 / 小宇宙 / 喜马拉雅 CDN 等实测允许); 不允许时页面会告诉你"服务器是活的但不让浏览器读",并给出替代办法。视频站(如 B 站 / YouTube)页面链接在浏览器内做不到,本页不做站内解析。
- v1 不含变速:WebAudio 的
AudioBufferSourceNode没有preservesPitch,改速率必然变调(语音会变成「快进的小黄人」)——「变速不变调」需要自研时间伸缩,排在下一阶段。 - 完整的离线编辑与工程保存能力随 App 端「音频库 / 长文朗读」配套规划。
入口联动
- 已打通:朗读页「端侧 kokoro」合成完的音频,可直接点「送到音频编辑」继续加工,不必先存盘再上传。
- 已打通:本地视频文件(mp4 / mov / webm)直接提音轨;播客 RSS 订阅链接可列单集挑一集下载。
- 环境音混音结果待环境音页实现后接入(编辑页已留好
window.__sendToEdit这个统一入口)。 - 两端功能清单由 000-plan-12 §1.4 统一约束,避免网页版先做出两套。
处理方式(可核对)
- 维护一份操作列表,每次改动都从原始音频重算 → 天然支持撤销,且试听听到的就是导出的那份数据。
- 原始上传的文件只在内存里读,永不被改写;重算全部在主线程用
Float32Array完成(WebAudio 的OfflineAudioContext在 worker 里不可用)。