OpenSound本地语音工作台
识别 · 朗读 · 对话 · 克隆 · 音频

一个 App,装下本地声音模型;
一张网页,先把它用起来。

OpenSound 桌面 App 把语音识别、文本朗读、本地对话、语音克隆做成本地点开即用,隐私不出本机;同时是开放端口后端(127.0.0.1:9528),供浏览器、网站、脚本接入。本站是它的零安装网页版——打开就能用「设备 + 云端 + 浏览器端侧模型」能力。

本地部署 模型装在自己电脑 隐私优先 不出网也能用 开放后端 9528 端口集成
OpenSound — 本地语音工作台 本地服务运行中
语音识别
SenseVoice · Whisper · 系统识别 · 云端
本地就绪
文本朗读
本地三引擎 · 系统音色 · 云端
本地就绪
本地对话
Qwen3 等本地 LLM · 云端 DeepSeek/智谱
本地就绪
语音克隆
CosyVoice3 本地克隆 · 云端克隆
本地就绪
开放后端
127.0.0.1:9528 · ASR / TTS / LLM / 克隆
CORS 开放
桌面 App 主界面示意(Windows / macOS)
层 ①

设备声音

浏览器系统音色 + 系统识别,零安装、免下载,默认秒开。

需要:无 · 免安装
层 ②

云端 API

高音质 / 多方言 / 克隆走云端,自填 Key 直连或轻代理免费档。

需要:Key(可选)· 出网
层 ③

端侧小模型

kokoro 中英混读、SenseVoice 识别、WebLLM 对话——浏览器里下载一次后离线可用。

需要:下载一次 · 之后离线
层 ④

本机 App 引擎

网页连上正在运行的 App(9528),临时解锁全部本地大模型引擎。

需要:已装 App + 授权 · 仅本机
三种打开方式

能力跟着「声音来源」走,网页先行、App 升级

同一个 OpenSound:装得越多,解锁越多。无论从哪进来,交互语言和云端供应商是同一套。

方式 A

只开网页零安装

本站工作台默认用设备能力(系统音色 / 系统识别),填了云端 Key 或下载端侧小模型后可更强。

方式 B

安装 App全能力主场

本地部署 SenseVoice / Whisper / CosyVoice / Qwen3 等大模型,断网也能识别、朗读、对话、克隆。

方式 C

网页 + App 同开最强档

网页自动探测本机 9528,经一次性授权握手接入 App 全部引擎(仅本机浏览器可连,天然安全)。

网页工作台

不装 App,本站自己也能出声出字

每个能力都是一个独立页面,引擎档位在界面上标清楚:设备(默认)/ 端侧(需下载)/ 云端(出网)/ 本机 App。其中朗读页的「设备系统声 / 微软在线声」两档已可试听,其余为骨架预览、按阶段接入。

网页版比 App 少的只是「本地部署大模型」——由浏览器端侧小模型补位;若本机开着 App,网页还能通过 9528 用回全部本地引擎(需 App 内开启「网页接入」并完成一次性授权握手)。
能力对照

App 与网页版,各做各强的部分

上排为能力,对应到 App / 网页的实现方式。同一套云端供应商与交互语言,差异只在“在哪里算”。

能力OpenSound App(全能力)网页版 · 本站
识别 ASR 本地 SenseVoice / Whisper + 系统识别 + 云端 设备 Web Speech(Edge / Safari)→ 端侧 SenseVoice → 云端
朗读 TTS 本地三引擎 + 系统音色 + 云端 设备系统声(Edge 含微软在线)→ 端侧 kokoro(中英混读)→ 云端
对话 LLM 本地 llama / Ollama + 云端 DeepSeek / 智谱 云端(默认)→ 端侧 WebLLM(WebGPU 桌面)
语音克隆 本地 CosyVoice3 + 云端克隆 仅云端 · 规划中(需本人声音授权)
实时语音 本地低延迟实时链路 降级:麦克风 + 云端 ASR/TTS 串联
环境音素材库 App 内规划中 网页直接可用(backhill R2 多轨混音)· 规划中
音频编辑 App 内规划中(与网页同一套清单) WebAudio 轻量版 · 待实现
人声伴奏分离 App 内规划中 不做(模型过重,引导下载 App)
隐私口径一致:凡出网的能力(云端、微软在线声)都会在界面标明「出网」;本地与设备能力默认优先。
下载 App

把全能力带回本机

模型权重与受管环境放在下载目录的数据根,升级 App 不影响模型;官方源 + 镜像自动切换。

Windows

Windows · x64

主推 Windows 11(Win10 已停止支持,尽力兼容)

安装包发布后在此提供 · 先看使用说明

macOS

macOS · Apple 芯片

Apple silicon + macOS 14+

从零验收进行中 · 安装包发布后在此提供

网页版

零安装 · 打开即用

无需下载,任何浏览器

本站工作台:设备 + 云端 + 端侧小模型

装好后,三步上手

  1. 1按顶部引导条点「安装 Node」(只需一次);要用 Qwen3 / SenseVoice / CosyVoice 时再点「安装 Python 基础」。
  2. 2模型管理页逐个下载引擎 —— 权重放数据根目录,官方源 / 镜像自动切换,断点续传。
  3. 3识别 / 朗读 / 对话 / 克隆即可用;其它 App、网站、脚本接 http://127.0.0.1:9528
首页/网页工作台/语音识别

语音识别

说话或上传音频,出文本。默认走设备系统识别;要离线大段转写或方言,切端侧 / 云端。

设备 Web Speech:Edge(走 Azure)与 Safari 可用,无需任何安装;Chrome 走 Google 云、国内不可用,会如实标注并引导换档——与 App 的引擎检测规则一致。
设备档已可直接录音识别(麦克风实时听写);端侧 SenseVoice 与云端 ASR 后续接入。音频文件转写需等端侧/云端档。
语音 → 文本 检测中…
就绪
点击「开始录音」后,这里会实时显示正在识别的文字。
0 字
识别 API检测中…
浏览器识别引擎
实时中间结果

手机端注意

  • 录音必须由一次用户点按触发授权;iOS Safari 尤其如此,否则不会开始采集。
  • 识别结果可手动修正后再复制或导出。

与 App 的差别

  • App 本地识别更稳、支持长音频与流式;网页端适合短时与体验。
  • 设备档只认麦克风:音频文件转写要等端侧 SenseVoice / 云端 ASR 接入。
关联:文本朗读 · 语音对话 来源参考:Web Speech / sherpa-onnx WASM / 智谱 ASR
首页/网页工作台/文本朗读

文本朗读

粘贴文本即出声。默认用系统音色秒开;Edge 额外列出微软在线声;想要更自然的音色再切端侧或云端。

设备 speechSynthesis 系统音色:全平台可用、免费离线、秒开。下方声音列表已按来源分组,选「本地系统声」里的声音即可直接试听。
已可直接使用:设备系统声 · 微软在线声(Edge)· 端侧 kokoro(中文 100 音色 + 英文 3 音色,本地离线合成,支持中英混读,可导出 WAV)。云端 / 连接本机 App 后续接入。
文本 → 语音 设备档 + 端侧 kokoro 均已可用(kokoro 支持导出 WAV)
音素 / 声调(高级 · 可编辑)
下面是这句自动算出的注音音素串:注音符号后跟的 1–5 是声调(5 = 轻声), / 是词间停顿。多音字念错或声调不对时,直接改这里再点「朗读」即可—— 改动后整句按你给的音素合成(中英混读与自动分词在此模式下失效,是刻意的)。
自动(跟随文本框)
朗读会按句切分逐句播放,长文本不会中途被浏览器掐断。
就绪
浏览器朗读 API检测中…
本地系统声 · 离线
微软在线声 · 仅 Edge · 出网

音色说明

  • 「本地系统声」离线免费;名字带 Online (Natural) 的微软声需联网、且只有 Edge 暴露。
  • 浏览器音色是延迟加载的,本页会在就绪后自动刷新下拉框与状态卡。

与 App 的差别

  • App 含本地三引擎 + 克隆音色与朗读历史库。
  • 云端档需要先在设置里填供应商 Key(只存本机)。
关联:语音识别 · 语音对话 · 音频编辑 来源参考:speechSynthesis / Microsoft Edge 在线声 / Kokoro-82M / glm-tts
首页/网页工作台/语音对话

语音对话

打字或说话提问,回答可再朗读出来。默认走云端 LLM;支持 WebGPU 的桌面浏览器可换端侧小模型。

云端 LLM(默认):DeepSeek / 智谱,自填 Key 直连或轻代理;对话结果支持一键朗读回放。
引擎档位切换为预览交互 · 未填 Key 时给出清晰引导,不做静默失败
对话 页面骨架 · 对话与语音链路待接入

对话面板

这里将提供多轮对话窗口、语音提问按钮、回答朗读开关,以及「边说边答」的降级实时模式。

文字提问 语音提问 回答朗读 多轮上下文 导出对话

实时语音

  • 网页版为降级实时:麦克风 + 云端 ASR/TTS 串联,非低延迟流式。
  • 要真正的低延迟实时对话,请在 App 内使用。

Key 与隐私

  • 对话内容会发给所选云端供应商,界面明确标注「出网」。
  • Key 只存在本机浏览器,官网不碰你的额度与账单。
关联:语音识别 · 文本朗读 来源参考:DeepSeek / 智谱 / WebLLM + Qwen3
首页/网页工作台/环境音素材库

环境音素材库

雨声、海浪、白噪音……多轨叠加成一段背景声。素材来自 backhill R2 目录,免 Key、可直接播放混音。

多轨混音台 规划中 · 素材接口与混音交互待接入

素材分类 + 混音面板

这里将提供素材分类浏览、试听、多轨叠加(Howler 播放)与音量平衡,混好的组合可一键导出。

雨 / 风 / 海浪分类 单轨试听 多轨叠加 每轨音量 导出混音

素材来源

  • 目录 JSON + 音频直链由 backhill R2 提供(whitenoise.earthtrip.online)。
  • 分类、命名与时长以素材库实际数据为准。

用途

  • 直接当背景声播放,或导出后送进音频编辑进一步处理。
  • 此能力 App 内同步规划中,两端清单一致。
关联:音频编辑 来源参考:000-plan-7(backhill R2 音频素材 API)
首页/网页工作台/音频编辑

音频编辑 待实现 · 预留页面

App 与网页版共用同一套常见能力清单:音量 / 分贝、变速(加速 / 减慢 / 放缓)、剪切 / 拼接、淡入淡出。网页端用 WebAudio 本地处理并导出 WAV。

轻量编辑器 待实现 · 页面骨架

波形 + 操作区

这里将提供:导入音频(录音 / 上传 / 上游引擎生成的结果)、波形显示,以及下面的编辑操作与导出。

音量 / 分贝 变速(加速 / 减慢 / 放缓) 剪切 / 拼接 淡入 / 淡出 导出 WAV

能力边界

  • 轻量版 = 浏览器 WebAudio 本地处理,无需后端,不传文件出网。
  • 完整的离线编辑与工程保存能力随 App 端「音频库 / 长文朗读」配套规划。

入口联动

  • 朗读工作台导出的音频、环境音混音结果都可送来这里继续加工。
  • 两端功能清单由 000-plan-12 §1.4 统一约束,避免网页版先做出两套。
关联:文本朗读 · 环境音 来源参考:000-plan-8(音频编辑)/ WebAudio