speech-to-speech 全栈语音 Agent

speech-to-speech 是 Hugging Face 出品的本地语音 Agent 全栈(10k stars / 月增 5k),本资源包为 Python 简化实现版,Whisper + Ollama + pyttsx3 完全本地化。

speech-to-speech 全栈语音 Agent,Hugging Face 出品的本地语音 Agent 全栈项目(10k+ stars / 月增 5k)Python 简化实现版,Whisper + Ollama + pyttsx3 完全本地化,已获商用授权,整理自素材市场采集库,欢迎下载使用。

speech-to-speech 全栈语音 Agent

Hugging Face speech-to-speech 项目的 Python 简化实现版,完整 pipeline:Whisper ASR(音频 → 文本)+ Ollama LLM(DeepSeek V4 Flash 生成回答)+ pyttsx3 TTS(文本 → 音频)。三步本地化运行,无需任何云端 API,保护隐私同时节省成本。

为什么选 speech-to-speech 做语音助手

市面上语音助手(Siri、小爱、天猫精灵)都强依赖云端,断网即废。speech-to-speech 是当月 GitHub Trending 月榜爆款,独有优势:完全本地化(Whisper/Ollama/pyttsx3 全部本地运行)、可定制(替换任意 LLM 模型 + prompt 调优)、多语言(Whisper 支持 99 种语言)、开源免费(Apache 2.0 + MIT License)。

使用场景

适合 AI 工具 场景下的素材使用,包括个人项目和商业项目,可直接应用或二次修改。speech-to-speech 全栈语音 Agent 特别适合:智能音箱 DIY(树莓派 + USB 麦克风 + 音箱)、车载语音(离线 + 隐私保护)、老人小孩陪伴(语音交互)、无障碍辅助(视障人士语音助手)。

包含内容

  • bin/full-pipeline.py 完整 pipeline(ASR → LLM → TTS)

  • scripts/download-models.py 模型下载脚本

  • config/pipeline.yaml pipeline 配置

  • requirements.txt Python 依赖

  • docs/README.md 完整文档

  • readme.txt 本资源说明

使用说明

1. 解压 zip 包
2. 安装 Python 3.10+ 和 Ollama
3. python scripts/download-models.py(首次运行下载模型)
4. python bin/full-pipeline.py input.wav
5. 输出 response.wav(AI 语音回答)

硬件要求

- 最低:8GB 内存
- 推荐:16GB + RTX 3060(Whisper 加速)

许可协议

- huggingface/speech-to-speech 遵循 Apache 2.0
- 本实现遵循 MIT License

版权声明

1. 本站文字内容为原创编撰或者网络搜集整理,受著作权保护,禁止未经授权批量采集转载。

2. 本站分享的各类源码、AI大模型、程序工具仅作技术科普部署教程使用,不直接存储原版版权文件。

3. 所有第三方资源的知识产权、开源协议、商用授权规则均归原开发团队所有。

4. 使用者下载、部署、二次开发必须严格遵守国家著作权相关法律法规,
以及资源官方许可协议,如需商业运营,务必向版权方申请合法授权。

5. 因用户私自商用、违规分发资源造成的法律纠纷与经济损失,
全部由使用者自行承担,本站不承担连带责任。

转载请说明出处 内容投诉
素材市场 » speech-to-speech 全栈语音 Agent

发表评论

您需要后才能发表评论

一个令你着迷的主题!

点击下载 VIP购买