Voicebox 0.5.0 for Mac:开源本地AI语音工作室,支持语音克隆与全局听写

blank发表于2 天前

Voicebox是一款开源、本地优先的AI语音工作室,作为ElevenLabs和WisprFlow的免费替代方案,完全在用户机器上运行。它支持从几秒参考音频克隆声音、跨七种TTS引擎生成语音、通过全局热键向任意应用听写,以及让MCP感知智能体使用用户克隆的声音发声。所有模型、音频、转录和LLM输出均不离开本机。

Voicebox 0.5.0 for Mac 破解版下载

软件适用于macOS(Apple Silicon和Intel)、Windows等平台。在Mac上可通过Apple Silicon的MLX(Metal)后端实现加速,或使用CPU推理。最低系统要求为macOS 11+、8GB内存、5GB可用存储空间和现代多核处理器。推荐配置为16GB以上内存和10GB以上存储。数据目录位于~/Library/Application Support/sh.voicebox.app/。首次启动时,所选TTS引擎会自动下载模型,大小从约350MB到8GB不等,后续使用缓存模型。

核心功能

用户可通过上传音频、麦克风录制或系统音频捕获创建语音档案,支持零样本克隆或50多种预设声音。软件提供七种TTS引擎,包括Qwen3-TTS、Qwen CustomVoice、LuxTTS、Chatterbox Multilingual、Chatterbox Turbo、HumeAI TADA和Kokoro,覆盖多达23种语言。生成支持后处理效果如音高偏移、混响、延迟等,以及副语言标签和自然语言表达控制。Stories编辑器可进行多轨时间轴创作,适合对话、播客或叙事场景。同时内置REST、WebSocket API和MCP服务器,便于集成。

0.5.0版本更新:捕获版

0.5.0版本被称为捕获版,使Voicebox从单纯的语音克隆工作室转变为完整的AI语音工作室。用户可在机器任意位置按住按键说话后松开,转录文本会进入当前焦点文本字段。反过来,任何MCP感知智能体可通过屏幕上的胶囊以用户克隆的声音发声。本地LLM介于两者之间,确保转录干净,语音档案可携带个性以重塑智能体输出。

听写功能新增全局热键捕获,macOS默认使用右Cmd加右Option。按住自定义组合键说话后松开,屏幕浮动胶囊会依次显示录制、转录、润色和完成状态,并带实时计时。支持按住说话和切换模式,各有独立组合键。转录完成后自动粘贴到启动时的焦点字段,兼容不同键盘布局,并保存恢复剪贴板。组合键选择器可在设置中自定义,默认设置避开系统快捷键冲突。若未授予macOS辅助功能权限,听写仍可运行并将转录存入Captures标签,仅禁用合成粘贴。

语音档案现支持可选个性描述,最长2000字符。启用后生成按钮旁出现两个控件,由本地Qwen3 LLM驱动:Compose按钮生成符合角色的新台词,Speak in character开关在TTS前将输入通过个性LLM重写。同一LLM兼作润色模型。API和MCP工具支持personality参数。

内置Model Context Protocol服务器运行于http://127.0.0.1:17493/mcp,支持Claude Code、Cursor、Windsurf、Cline、VS Code等MCP感知智能体调用。提供voicebox.speak、voicebox.transcribe、voicebox.list_captures和voicebox.list_profiles四个工具。支持流式HTTP传输和stdio适配器,可按客户端绑定特定声音,并显示发声胶囊。

润色环节通过本地Qwen3 LLM去除填充词、修正标点并可选处理自我纠正。新增循环剥离机制处理Whisper幻觉重复。每条捕获保存标志快照,便于后续重新润色。模型可选Qwen3 0.6B、1.7B或4B。Captures标签整合听写、转录、润色、播放和存储设置。Stories标签升级为真正时间轴编辑器,支持导入外部音频、逐片段音量调节和灵活轨道堆叠。

Mac软件资讯
20

全部评论 0

暂无跟帖

没有了

到底了

查看更多

发表评论

点击这里给我发消息2507222545请先加好友
在线客服加载中...