关于

OpenSound

本地的声音工作台:语音识别、文本朗读、音频剪辑在浏览器与本机上完成。能力分四层,每层是否联网、数据去哪,逐条标注、可核对。

能力分层与出网标注

  • 设备层:系统语音合成 / 系统麦克风听写——数据不出网(由操作系统本地处理)。
  • 端侧层:Kokoro(朗读)、SenseVoice(识别)等浏览器端侧模型——模型首次使用时下载,之后断网可用;音频与文本不出网
  • 云端层:自填 Key 直连云服务商——出网,数据发往对应服务商。
  • 链接导入(编辑页):从播客 RSS / 直链下载音频——出网,文件由对方服务器直接送达你的浏览器,本站无中转服务器。

模型与许可(署名)

文本朗读

  • Apache-2.0Kokoro-82M v1.1-zh(onnx-community/Kokoro-82M-v1.1-zh-ONNX)。

语音识别

  • FunASR MODEL_LICENSE v1.1SenseVoiceSmall,作者 FunASR / FunAudioLLM(阿里通义实验室)。模型卡: huggingface.co/FunAudioLLM/SenseVoiceSmall。 按许可要求注明模型名称与出处(非 OSI 认证;允许商用,义务为署名 + 保留模型名)。
  • 不出网使用官方血统的 2024-07-17 版权重,下载地址钉在固定 revision,由浏览器直接下载并缓存本机。

组件

  • Apache-2.0推理运行时 sherpa-onnx(k2-fsa)。
  • MIT长音频切段 Silero VAD(取自官方 VAD Space)。
  • MIT / LGPL-2.1+本地转码器 ffmpeg.wasm(@ffmpeg/ffmpeg、@ffmpeg/core,npm 元数据为 MIT;其内部 FFmpeg 为 LGPL-2.1+ 构建,由浏览器按需从 CDN 动态加载、不静态链接进本站代码)。默认单线程 core 约 31MB,只在用户于识别页点「用本地转码器再试 / 转 WAV / 转 MP3」时才下载,之后走本机缓存、处理不出网。用途:华为 / 鸿蒙等机型上浏览器自带解码器缺失时,由它自带解码器把 AAC / ALAC / AMR / mov 等解出来。

联系与开源

开源仓库整理中;问题与反馈可通过仓库 issue 提出。