Mac 自带听写
慢,还不爱加标点 说完还要自己收拾一通 FluidVoice 按住热键说话 松开字就进当前 App 识别和润色都在本机 一个字节不出门 引擎能换 Parakeet、Whisper、Apple Speech 顺手还能语音开应用 一万星 brew 一条命令 专门砸 Wispr 那种月费
把电影号剪辑从熬夜手工,压成 Claude Code 一条指令——这是 video-recap-skills 想做的事。
自然语言 → 中文解说成片,面向 Claude Code / Codex 等宿主。 能省重复劳动,但素材版权、配音质量、平台审核仍是你的责任。 链接放评论。
Google 开源了 Gemma Translator:完全离线的可组装翻译装置。
用 Gemma 4 + 树莓派 5、小屏、喇叭、键盘旋钮等市售件 + 3D 打印壳。 重点:不需 Wi-Fi、不需 API;语音识别和 TTS 都在端侧。 「再也不用学语言」当然是夸张,但离线、可动手、可带走的翻译硬件路线,确实在打开。 仓库在第二条。
想跑语音/音频类 AI,这 4 个开源项目今天就能直接用:
1. Whisper——OpenAI 的语音识别,把语音转成文字 2. F5-TTS——文本转语音,效果自然 3. Coqui TTS——另一个成熟的文本转语音方案 4. RVC——变声/音色转换,把一个人的声音换成另一个人的音色 都是开源,本地能跑,链接放在评论区。 1. Whisper: https://github.com/openai/whisper 2. F5-TTS: https://
处理长播客最亏的时间不是听,是转录——同一段音频,为了换个总结角度就要重新跑一遍语音转文字。
有个工具叫 audio-tldr 专治这个浪费:本地转录一次,文字稿直接缓存,之后想怎么换角度总结都不用再碰转录环节。 支持 Claude Code 和 Codex 直接装。还没亲自跑过,但这个只转录一次、反复复用的思路本身就值得先收藏。
李博杰(华为天才少年)这本 AI Agent 实践书值得系统学一下。
不是空泛讲概念,而是从实际讲学、代码实践里迭代出来的材料;前言里也提到通过 whisper coding 持续打磨。PDF 风格一看就很“实战派”。 t.me/tudouge_ai_notes 进入群免费领取。
不会写代码也想做产品:有人靠 Claude Code 做了 Mac 语音输入软件 Speakey,免费开源。
按住右 Option 说话,松手文字进光标处;自动清语气词/补标点;台英日韩+自动检测;本地隐私、用自己的 Groq 额度。 辨识 whisper-large-v3,修饰走开源模型。点子够了,缺的是动手那一下。
OmniDesk v2.4.0:直接对终端说话。
点麦克风(或 Ctrl+Shift+Space),说完 prompt,文字会进 Claude Code / Codex。 本地 Whisper 转写,音频不出机器,没有云、不需要 API Key。发出前你还能先改一改。 终端 + 语音,终于不用边敲边组织长 prompt 了。
靠做影片吃饭的 AI 龙虾,把吃饭的手艺整套送出去了。
手绘风投影片、旁白配音、字幕自动对齐、封面、发音逐字校对——全部打包成一个 skill,MIT 授权开源。 不管你用哪个 AI 工具,装上去就能自己按这套流程做出一支片。 手艺藏着会烂,摊在阳光下才会长。
语音助理的四层架构:VAD → 语音识别 → LLM → 语音合成,这四层常常来自不同服务商。想换掉其中一家,往往得整组管线重写。
Hugging Face 开源了 speech-to-speech,把这四层模块化,让你像换零件一样替换其中一段。 • VAD、STT、LLM、TTS 各自都能替换,不绑死单一供应商 • 可以直接把 OpenAI Realtime API 换成本地版本,不用重写整套逻辑 • 所有模型都能在本地跑,语音数据不必离开自己的机器
GitHub 上来了一个项目:Pixelle-Video。
输入一句话,它自己写文案、AI 生图、自己配音、自己上字幕,最后吴一下吹出一条完整短视频。 就是那种一键全自动的终极形态。 专门为批量做号设计的,支持对接各种开源大模型和免费 API,成本压到极低。 一个人顶一个短视频团队。
一句话生成完整短视频——
Pixelle-Video 全链路闭环:写文案、AI 生图生视频、配音、上字幕,自动吐出成品。 支持开源模型和免费 API,成本极低。 本地部署,批量生产。 一个人顶一个短视频团队。
Meetily——完全本地的 AI 会议助手
Whisper 实时转录,快 4 倍 说话人分离 + Ollama 摘要 macOS & Windows 均可 数据永不上云,隐私 100% 在你手中。 ⭐ 17,716(+1,409 今日)
FluidVoice — Mac 上完全本地跑的语音听写,3.7K ⭐,今日涨 365。
按住热键说话,实时转文字直接敲进任何输入框。识别和 AI 润色全在本机完成,不用云、不用 API key,语音一个字都不离开你的 Mac。 · 支持 Parakeet / Whisper / Apple 语音,覆盖近百种语言 · 本机 AI 润色,自动断句和大小写 · 命令模式:动嘴就能开 App、跑快捷指令 · 全局热键,任何软件随时唤起 顺手退订那些按月收费的听写 App。
很好用的语音转文字小工具
完全本地推理,无须配置 Python、Docker,Windows 点开就能用。 自动下载模型,原生支持说话人分离、时间轴对齐,目前支持 BreezeASR26 与 QwenASR 两种模型。
开源本地语音工作室 Voicebox 来了。
它把语音克隆、TTS 生成、全局热键语音输入、甚至让 AI Agent 用你克隆的声音说话,全都做进了本地运行。支持 7 种 TTS 引擎、23 种语言,模型和数据完全不离开你的机器。 想同时替代 ElevenLabs(输出)和 Wispr Flow(输入),又不想把声音数据上传云端,这可能是目前最完整、最隐私的本地方案。 支持多轨故事编辑、音效处理、MCP 工具调用,macOS/Windows/
Lingji Cut 把写稿、AI 配音、字幕、剪辑、导出串成一条线,本地跑,开源免费,数据不上传。
解决视频创作 4️⃣ 大痛点: 📍 工具割裂:一个软件搞定所有环节,再也不用切来切去 📍 数据安全:所有文件本地保存,零上传,隐私彻底有保障 📍 AI 碎片化:支持多 AI 模型(OpenAI、Gemini、LM Studio、MiniMax 等),随便选 📍 流程繁琐:自动化 Agent 流水线,效率直接拉满!