OctoNews

笔记 · AI 工具

音频

AI 工具中与音频相关的内容。 共 17 条。

Thread

Mac 自带听写

慢,还不爱加标点 说完还要自己收拾一通 FluidVoice 按住热键说话 松开字就进当前 App 识别和润色都在本机 一个字节不出门 引擎能换 Parakeet、Whisper、Apple Speech 顺手还能语音开应用 一万星 brew 一条命令 专门砸 Wispr 那种月费

Thread

想跑语音/音频类 AI,这 4 个开源项目今天就能直接用:

1. Whisper——OpenAI 的语音识别,把语音转成文字 2. F5-TTS——文本转语音,效果自然 3. Coqui TTS——另一个成熟的文本转语音方案 4. RVC——变声/音色转换,把一个人的声音换成另一个人的音色 都是开源,本地能跑,链接放在评论区。 1. Whisper: https://github.com/openai/whisper 2. F5-TTS: https://

Thread

OmniDesk v2.4.0:直接对终端说话。

点麦克风(或 Ctrl+Shift+Space),说完 prompt,文字会进 Claude Code / Codex。 本地 Whisper 转写,音频不出机器,没有云、不需要 API Key。发出前你还能先改一改。 终端 + 语音,终于不用边敲边组织长 prompt 了。

Thread

语音助理的四层架构:VAD → 语音识别 → LLM → 语音合成,这四层常常来自不同服务商。想换掉其中一家,往往得整组管线重写。

Hugging Face 开源了 speech-to-speech,把这四层模块化,让你像换零件一样替换其中一段。 • VAD、STT、LLM、TTS 各自都能替换,不绑死单一供应商 • 可以直接把 OpenAI Realtime API 换成本地版本,不用重写整套逻辑 • 所有模型都能在本地跑,语音数据不必离开自己的机器

Thread

GitHub 上来了一个项目:Pixelle-Video。

输入一句话,它自己写文案、AI 生图、自己配音、自己上字幕,最后吴一下吹出一条完整短视频。 就是那种一键全自动的终极形态。 专门为批量做号设计的,支持对接各种开源大模型和免费 API,成本压到极低。 一个人顶一个短视频团队。

Thread

一句话生成完整短视频——

Pixelle-Video 全链路闭环:写文案、AI 生图生视频、配音、上字幕,自动吐出成品。 支持开源模型和免费 API,成本极低。 本地部署,批量生产。 一个人顶一个短视频团队。

Thread

FluidVoice — Mac 上完全本地跑的语音听写,3.7K ⭐,今日涨 365。

按住热键说话,实时转文字直接敲进任何输入框。识别和 AI 润色全在本机完成,不用云、不用 API key,语音一个字都不离开你的 Mac。 · 支持 Parakeet / Whisper / Apple 语音,覆盖近百种语言 · 本机 AI 润色,自动断句和大小写 · 命令模式:动嘴就能开 App、跑快捷指令 · 全局热键,任何软件随时唤起 顺手退订那些按月收费的听写 App。

Thread

开源本地语音工作室 Voicebox 来了。

它把语音克隆、TTS 生成、全局热键语音输入、甚至让 AI Agent 用你克隆的声音说话,全都做进了本地运行。支持 7 种 TTS 引擎、23 种语言,模型和数据完全不离开你的机器。 想同时替代 ElevenLabs(输出)和 Wispr Flow(输入),又不想把声音数据上传云端,这可能是目前最完整、最隐私的本地方案。 支持多轨故事编辑、音效处理、MCP 工具调用,macOS/Windows/

Thread

Lingji Cut 把写稿、AI 配音、字幕、剪辑、导出串成一条线,本地跑,开源免费,数据不上传。

解决视频创作 4️⃣ 大痛点: 📍 工具割裂:一个软件搞定所有环节,再也不用切来切去 📍 数据安全:所有文件本地保存,零上传,隐私彻底有保障 📍 AI 碎片化:支持多 AI 模型(OpenAI、Gemini、LM Studio、MiniMax 等),随便选 📍 流程繁琐:自动化 Agent 流水线,效率直接拉满!