一个 App,装下本地声音模型;
一张网页,先把它用起来。
OpenSound 桌面 App 把语音识别、文本朗读、本地对话、语音克隆做成本地点开即用,隐私不出本机;同时是开放端口后端(127.0.0.1:9528),供浏览器、网站、脚本接入。本站是它的零安装网页版——打开就能用「设备 + 云端 + 浏览器端侧模型」能力。
设备声音
浏览器系统音色 + 系统识别,零安装、免下载,默认秒开。
云端 API
高音质 / 多方言 / 克隆走云端,自填 Key 直连或轻代理免费档。
端侧小模型
kokoro 中英混读、SenseVoice 识别、WebLLM 对话——浏览器里下载一次后离线可用。
本机 App 引擎
网页连上正在运行的 App(9528),临时解锁全部本地大模型引擎。
能力跟着「声音来源」走,网页先行、App 升级
同一个 OpenSound:装得越多,解锁越多。无论从哪进来,交互语言和云端供应商是同一套。
只开网页零安装
本站工作台默认用设备能力(系统音色 / 系统识别),填了云端 Key 或下载端侧小模型后可更强。
安装 App全能力主场
本地部署 SenseVoice / Whisper / CosyVoice / Qwen3 等大模型,断网也能识别、朗读、对话、克隆。
网页 + App 同开最强档
网页自动探测本机 9528,经一次性授权握手接入 App 全部引擎(仅本机浏览器可连,天然安全)。
不装 App,本站自己也能出声出字
每个能力都是一个独立页面,引擎档位在界面上标清楚:设备(默认)/ 端侧(需下载)/ 云端(出网)/ 本机 App。其中朗读页的「设备系统声 / 微软在线声」两档已可试听,其余为骨架预览、按阶段接入。
语音识别
说话或上传音频 → 出文本。设备 Web Speech 打底,端侧 SenseVoice 离线大段转写,云端覆盖方言。
文本朗读
粘贴文本 → 出声。系统声、Edge 微软在线声、端侧 kokoro(中英混读)均已可用;云端后续接入。
语音对话
文字 / 语音提问,云端 LLM 回答,回答可朗读。WebGPU 桌面浏览器可切端侧小模型。
环境音素材库
雨声、海浪、白噪音多轨混音,直接当背景声播放。复用 backhill R2 素材目录,免 Key。
音频编辑
音量、变速、剪切拼接、淡入淡出。App 与网页用同一套能力清单,网页端先上 WebAudio 轻量版。
语音克隆
浏览器端侧没有成熟克隆方案,留给云端或 App。需本人声音授权,官网仅做入口引导。
App 与网页版,各做各强的部分
上排为能力,对应到 App / 网页的实现方式。同一套云端供应商与交互语言,差异只在“在哪里算”。
| 能力 | OpenSound App(全能力) | 网页版 · 本站 |
|---|---|---|
| 识别 ASR | 本地 SenseVoice / Whisper + 系统识别 + 云端 | 设备 Web Speech(Edge / Safari)→ 端侧 SenseVoice → 云端 |
| 朗读 TTS | 本地三引擎 + 系统音色 + 云端 | 设备系统声(Edge 含微软在线)→ 端侧 kokoro(中英混读)→ 云端 |
| 对话 LLM | 本地 llama / Ollama + 云端 DeepSeek / 智谱 | 云端(默认)→ 端侧 WebLLM(WebGPU 桌面) |
| 语音克隆 | 本地 CosyVoice3 + 云端克隆 | 仅云端 · 规划中(需本人声音授权) |
| 实时语音 | 本地低延迟实时链路 | 降级:麦克风 + 云端 ASR/TTS 串联 |
| 环境音素材库 | App 内规划中 | 网页直接可用(backhill R2 多轨混音)· 规划中 |
| 音频编辑 | App 内规划中(与网页同一套清单) | WebAudio 轻量版 · 待实现 |
| 人声伴奏分离 | App 内规划中 | 不做(模型过重,引导下载 App) |
把全能力带回本机
模型权重与受管环境放在下载目录的数据根,升级 App 不影响模型;官方源 + 镜像自动切换。
Windows · x64
主推 Windows 11(Win10 已停止支持,尽力兼容)
安装包发布后在此提供 · 先看使用说明
macOS · Apple 芯片
Apple silicon + macOS 14+
从零验收进行中 · 安装包发布后在此提供
零安装 · 打开即用
无需下载,任何浏览器
本站工作台:设备 + 云端 + 端侧小模型
装好后,三步上手
- 1按顶部引导条点「安装 Node」(只需一次);要用 Qwen3 / SenseVoice / CosyVoice 时再点「安装 Python 基础」。
- 2模型管理页逐个下载引擎 —— 权重放数据根目录,官方源 / 镜像自动切换,断点续传。
- 3识别 / 朗读 / 对话 / 克隆即可用;其它 App、网站、脚本接 http://127.0.0.1:9528。
语音识别
说话或上传音频,出文本。默认走设备系统识别;要离线大段转写或方言,切端侧 / 云端。
手机端注意
- 录音必须由一次用户点按触发授权;iOS Safari 尤其如此,否则不会开始采集。
- 识别结果可手动修正后再复制或导出。
与 App 的差别
- App 本地识别更稳、支持长音频与流式;网页端适合短时与体验。
- 设备档只认麦克风:音频文件转写要等端侧 SenseVoice / 云端 ASR 接入。
文本朗读
粘贴文本即出声。默认用系统音色秒开;Edge 额外列出微软在线声;想要更自然的音色再切端侧或云端。
音素 / 声调(高级 · 可编辑)
1–5 是声调(5 = 轻声),
/ 是词间停顿。多音字念错或声调不对时,直接改这里再点「朗读」即可——
改动后整句按你给的音素合成(中英混读与自动分词在此模式下失效,是刻意的)。
音色说明
- 「本地系统声」离线免费;名字带 Online (Natural) 的微软声需联网、且只有 Edge 暴露。
- 浏览器音色是延迟加载的,本页会在就绪后自动刷新下拉框与状态卡。
与 App 的差别
- App 含本地三引擎 + 克隆音色与朗读历史库。
- 云端档需要先在设置里填供应商 Key(只存本机)。
语音对话
打字或说话提问,回答可再朗读出来。默认走云端 LLM;支持 WebGPU 的桌面浏览器可换端侧小模型。
对话面板
这里将提供多轮对话窗口、语音提问按钮、回答朗读开关,以及「边说边答」的降级实时模式。
实时语音
- 网页版为降级实时:麦克风 + 云端 ASR/TTS 串联,非低延迟流式。
- 要真正的低延迟实时对话,请在 App 内使用。
Key 与隐私
- 对话内容会发给所选云端供应商,界面明确标注「出网」。
- Key 只存在本机浏览器,官网不碰你的额度与账单。
环境音素材库
雨声、海浪、白噪音……多轨叠加成一段背景声。素材来自 backhill R2 目录,免 Key、可直接播放混音。
素材分类 + 混音面板
这里将提供素材分类浏览、试听、多轨叠加(Howler 播放)与音量平衡,混好的组合可一键导出。
素材来源
- 目录 JSON + 音频直链由 backhill R2 提供(whitenoise.earthtrip.online)。
- 分类、命名与时长以素材库实际数据为准。
用途
- 直接当背景声播放,或导出后送进音频编辑进一步处理。
- 此能力 App 内同步规划中,两端清单一致。
音频编辑 待实现 · 预留页面
App 与网页版共用同一套常见能力清单:音量 / 分贝、变速(加速 / 减慢 / 放缓)、剪切 / 拼接、淡入淡出。网页端用 WebAudio 本地处理并导出 WAV。
波形 + 操作区
这里将提供:导入音频(录音 / 上传 / 上游引擎生成的结果)、波形显示,以及下面的编辑操作与导出。
能力边界
- 轻量版 = 浏览器 WebAudio 本地处理,无需后端,不传文件出网。
- 完整的离线编辑与工程保存能力随 App 端「音频库 / 长文朗读」配套规划。
入口联动
- 朗读工作台导出的音频、环境音混音结果都可送来这里继续加工。
- 两端功能清单由 000-plan-12 §1.4 统一约束,避免网页版先做出两套。