每日开源 · 第 090 期
FluidVoice
当语音转文字都在上云,这个 Mac 项目选择了全本地
8 种 ASR 引擎 · 本地 AI 润色 · 语音操控 Mac
2026-07-11 · 周五
⚠️ 免责声明:本工具依赖境外公开数据源(GitHub 等),部分平台在中国大陆需合规网络环境访问。本文仅作技术分析,不构成任何投资或商业决策建议。
7.2k+
Stars
8
ASR 后端
40+
语言
<100ms
感知延迟
📦 项目速览
项目名FluidVoice
作者altic-dev
语言Swift 99.7%
协议GPLv3(核心开源,Fluid Intelligence 闭源)
版本v1.6.2(2026-07-06 构建)
Stars7,257+ · 今日 +830 🔥
定位macOS 最快的本地语音听写应用 + AI 润色 + 语音控制
标签语音转文字本地优先SwiftmacOS隐私****AI 增强
🎯 它能解决什么问题?
❌ 云端语音工具数据上传 — Otter.ai、Wispr Flow 等默认把你的语音数据上传到云端服务器。在法律、医疗、金融等合规行业,语音数据出境是不被允许的。
❌ macOS 自带听写精度差 — 按两次 Fn 键能用,但识别精度对中文、专业术语几乎不可用,而且部分功能依赖网络。
❌ 没有模型选择权 — 不管是云端还是系统自带,模型是厂商替你决定的。你说中文它可能给你跑了个英语优先模型,识别结果满屏乱码。
❌ 订阅费用持续出血 — Wispr Flow 个人版 $15/月,Otter.ai Pro $16.99/月。一个听写工具,一年要花近 200 美元。
❌ 没有语音控制能力 — 只能"说话变文字",不能"说话操控电脑"。写邮件、开应用、跑快捷指令——全是手动。
✅ FluidVoice 的回答:语音数据默认全部留在你的 Mac,8 种 ASR 后端你自己选,Fluid-1 本地 AI 模型做后处理润色,Command Mode 让你用语音操控整台 Mac——而且,永久免费,无任何订阅层级。
💡 核心亮点
🎙️ 亮点一:8 种 ASR 后端随便挑
FluidVoice 不是绑定某一家语音模型,而是把市面上主流的本地 ASR 引擎全塞进同一个 SwiftUI 应用里。从零下载的 Apple Speech 到高精度 Whisper Large,从 NVIDIA Parakeet 到 Cohere Transcribe——选择权在你手里。
Nemotron Speech 3.5 — Ultra Fast Low Latency
流式多语言听写,~670 MB,Apple Silicon 专用
~40 种语言 · 流式 · 低延迟首选
Nemotron 3.5 Multilingual
更高精度多语言听写,~530 MB,Apple Silicon
~40 种语言 · 精度优先
Parakeet Flash (Beta)
英语最低延迟实时听写,~250 MB,NVIDIA 出品
英语专用 · 最低延迟 · v1.6 主推
Parakeet TDT v3
25 种语言快速默认听写,~500 MB,体积精度甜点
25 种语言(含中文普通话)· 推荐默认
Cohere Transcribe
高精度多语言听写,~1.4 GB,含中文日韩阿拉伯语
14 种语言 · 高精度 · 体积最大
Apple Speech
零下载原生 macOS 语音,系统自带
系统语言 · 零下载兜底 · Intel Mac 可用
Whisper (tiny/base/small/medium/large)
最广兼容性,Intel Mac 的唯一选择
99 种语言 · Intel 唯一选项 · 75MB~2.9GB
💡 模型选择决策树:Apple Silicon + 中文用户 → Parakeet TDT v3(25 种语言含中文,~500 MB);英语追求最低延迟 → Parakeet Flash;Intel Mac → Whisper medium 或 large。
🧠 亮点二:Fluid Intelligence — 本地 AI 润色层
ASR 把声音转成文字只是第一步。Fluid Intelligence 是 v1.6.0 主推的核心特性——一个完全本地运行的 AI 模型,在转录之后跑一遍智能润色。
它能做什么:
· 智能格式化 — 把"逗号 句号 句号"自动改成正常标点
· 上下文感知大小写 — 识别人名、地名、缩写自动大写
· 自适应语调 — 根据当前活跃应用自动调整输出风格
· 后处理修正 — 修正日期、姓名、数字格式
· 零数据外传 — 无需云端、无需 API 密钥,约 3.5 GB 本地模型
⚠️ README 原话:"We’re keeping Fluid Intelligence private for now so we can sustainably offer the core dictation experience for free."核心听写 App 是 GPLv3 完全开源,但 Fluid-1 模型本身是 altic-dev 私有的商用资产。这个分层许可在开源听写类项目里属于正常操作——你可以自由审计主程序代码,但不能自行编译 Fluid-1 模型。
🎭 亮点三:自适应语调 — 同一句话,不同输出
这是 FluidVoice 最有意思的功能。它自动检测当前聚焦的应用,然后为同一段语音选择不同的语调配置文件。
同一句话,不同场景,输出截然不同:
🎤 你的原始语音:
“hey so um the deploy broke because of the config change from yesterday, I fixed it but we should probably review those before pushing to prod going forward”
💬 Slack [#engineering](javascript:😉(随意语调):
“hey team — deploy broke from yesterday’s config change. fixed it now, but we should probably start reviewing configs before pushing to prod”
📧 邮件(正式语调):
“Hi team, the deployment failed due to a configuration change made yesterday. I have resolved the issue. Going forward, I recommend we review configuration changes before deploying to production.”
📝 GitHub Issue(结构化语调):
Issue [#142](javascript:😉 · Deployment failed — config change · Resolution: Fixed and verified in staging · Action item: Require config review before prod push
📋 个人笔记(精简语调):
“deploy broke from yesterday’s config change. fixed it. need to set up config review before prod pushes going forward.”
你还可以为任何应用编写自定义提示词——Slack 随意、邮件正式、GitHub 结构化、VS Code 注释风格——完全由你定义。
⚡ 亮点四:Command Mode — 语音操控 Mac
不只是"说话变文字",而是**“说话操控电脑”**。按下热键 + 说出命令词,FluidVoice 触发 macOS 的应用启动、快捷键、系统操作。
· “Open Safari” → 启动 Safari
· “Send message to Alice” → 调用 Messages
· “Run shortcut 晨间例程” → 执行 Apple Shortcut
底层走的是 CommandModeService + FunctionCallingProvider,结合 macOS Shortcuts、Accessibility API 和自定义 function calling schema。Command Mode 完全本地,不需要任何云 API。
✍️ 亮点五:Write Mode — 任意文本框语音输入
选中任意文本框里的一段文字,按下热键说"改写得更正式一点"或者"翻译成英文",FluidVoice 调用可选 AI provider 重写这段文字,再直接替换回去。
支持 4 种 AI Provider:
· OpenAI(云端)
· Groq(云端,速度快)
· 自定义 OpenAI 兼容端点
· Fluid Intelligence(本地,约 3.5 GB 模型)
API Key 安全存储于 macOS Keychain,代码侧由 KeychainService 负责。
👀 亮点六:Live Preview — 刘海感知浮层
v1.6.0 新增实时转录浮层,支持 MacBook 刘海屏适配。说话时文字实时出现在浮层中,松开热键后自动插入光标位置。浮层形态可配置——从药丸形到大型浮层,一切皆可选。
🛠️ 实战场景展示
场景一:写英文邮件
在邮件客户端中按下热键,说出:“Dear John, I hope this email finds you well. I’m writing to confirm our meeting scheduled for next Tuesday at 2 PM.”
Fluid Intelligence 自动添加标点、格式化段落,并注入邮件正文。语调自动切换为正式风格。
场景二:代码注释听写
在 Xcode 中按下热键,说出:“Function to load user preferences from JSON file, returns dictionary or empty if file not found.”
文字直接注入到代码注释位置,无需手动输入。语调自动切换为技术描述风格。
场景三:语音控制 Mac
按下热键说"Open Safari 搜 GitHub",FluidVoice 立刻启动 Safari 并触发搜索。全程不碰键盘。
还可以说"Run shortcut 晨间例程"触发一连串 macOS 快捷指令自动化。
场景四:合规行业语音记录
法律、医疗、金融等行业有严格的语音数据合规要求——数据不能出境。FluidVoice 默认全本地运行,零上传,是这些行业目前 macOS 上最好的听写选择。
⚔️ 竞品对比
FluidVoice vs macOS 自带听写 vs Otter.ai
离线可用 FluidVoice ✅ 完全离线 · macOS 听写 部分依赖网络 · Otter ❌
模型选择 FluidVoice 8 种 · macOS 系统固定 · Otter 厂商固定
数据隐私 FluidVoice 零上传 · macOS Apple 处理 · Otter 上传云端
跨 App FluidVoice ✅ 任意文本框 · macOS 仅系统文本框 · Otter 仅 App 内
命令控制 FluidVoice ✅ 系统操作 · macOS ❌ · Otter ❌
开源 FluidVoice GPLv3 · macOS ❌ · Otter ❌
价格 FluidVoice 免费 · macOS 免费 · Otter 免费/订阅
FluidVoice vs Wispr Flow(商业竞品)
价格 FluidVoice 永久免费 · Wispr Flow $15/月
数据隐私 FluidVoice 零上传 · Wispr Flow 云端处理
AI 润色 FluidVoice 本地 Fluid-1 · Wispr Flow 云端模型
模型选择 FluidVoice 8 种 · Wispr Flow 厂商固定
开源 FluidVoice GPLv3 · Wispr Flow 闭源
社区用户评价:“This is a really impressive app, speedy and accurate. It’s just as good as Wispr Flow in my testing.”
🚧 适用边界
✅ 适合:
· Apple Silicon + macOS 15+ 用户,希望把听写、命令模式、改写模式三件事在一个应用里搞定
· 有数据合规要求的行业(法律、医疗、金融)——云端听写不可用,本地是唯一选择
· 对 Apple 原生听写精度不满意的用户——8 种模型意味着可以换更好的
· 想要语音控制 Mac 的用户——Command Mode 是意外惊喜
⚠️ 不太适合:
· Intel Mac 用户——除 Whisper 之外所有模型都要求 Apple Silicon,体验打折扣
· macOS 14 或更早系统的用户——最低 macOS 15.0 Sequoia
· 需要完全开源栈的用户——Fluid-1 模型本身是私有的
· 需要会议转录 + 摘要全流程的用户——FluidVoice 不做这个,Otter.ai 更合适
🚀 上手指南
# 一行命令安装(推荐)brew install –cask fluidvoice# 或者手动下载 DMG/PKG# https://github.com/altic-dev/FluidVoice/releases/latest# 从源码构建git clone https://github.com/altic-dev/FluidVoice.gitcd FluidVoiceopen Fluid.xcodeproj# 在 Xcode 中 Build and Run# 或使用构建脚本:./build.sh
1****安装
Homebrew Cask 一行安装,或从 Releases 手动下载。两条路功能无差异。
2****授权
首次启动时授予麦克风和辅助功能权限。两者都建议"始终允许",否则 macOS 会在重启后反复弹窗。
3****设全局热键
进设置挑一个全局热键(推荐 ⌥ Space)。FluidVoice 推荐按住说话、松开停止,类似对讲机模式。
4****选 ASR 后端
中文用户推荐 Parakeet TDT v3(25 种语言含中文,~500 MB)。英语用户追求最低延迟选 Parakeet Flash。Intel Mac 只能用 Whisper。
5****启用 Fluid Intelligence(可选)
在引导流程中下载本地 AI 模型(约 3.5 GB)。如果 Mac 内存较小(8 GB),建议先用云端 AI provider,等后续版本再评估。
6****添加云端 AI Provider(可选)
添加 OpenAI、Groq 或自定义端点 API Key(安全存储于 macOS Keychain)。选"Always allow"以避免反复弹窗。
💡 我的推荐顺序(来自 txtmix.com 深度文章):先用 Apple Speech 跑一遍 Onboarding 确认流程通了 → 切到 Parakeet TDT v3 当默认 → 嫌识别不准叠 OpenAI 作为改写 provider → Fluid Intelligence 等 v1.7 系列再观察(3.5 GB 内存对老款 M 系列不太友好)。
# 模型选择决策树# 你有 Apple Silicon Mac 吗?ifApple_Silicon: if中文/多语种: → Parakeet TDT v3# 25语种, ~500MBelif英语+最低延迟: → Parakeet Flash# ~250MBelse: → Nemotron Speech 3.5# 流式, ~670MBelseIntel_Mac: → Whisper medium/large# 唯一选项
🏗️ 架构速览
# FluidVoice 三层架构# 第一层:语音捕获 + 模型选择层麦克风 → 全局快捷键触发 → 模型选择层 Nemotron 3.5 │ Parakeet │ Cohere Apple Speech │ Whisper (T/S/M/L) → # 本地推理 (Apple Silicon / Intel)# 第二层:转录输出 → Live Preview (刘海感知浮层) → 直接插入当前光标位置 # 第三层:可选增强 → Fluid Intelligence# 本地 AI 增强层 智能格式化 · 上下文大小写 · 自适应语调 → 云端 AI Provider# 可选 OpenAI / Groq / 自定义端点
关键依赖(Package.swift 6 个):
· FluidAudio — 自家音频框架,承载 Parakeet/Nemotron/Cohere
· SwiftWhisper — Whisper 的 Swift 封装
· DynamicNotchKit — 自家组件,MacBook 刘海实时转录浮层
· AppUpdater — 自动更新
· PromiseKit — Promise 链
· PostHog — 匿名分析(默认开启,可在设置关闭)
核心源码规模:
· ContentView.swift — 188 KB,主 SwiftUI 视图
· ASRService.swift — 150 KB,转写核心调度
· GlobalHotkeyManager.swift — 86 KB,热键管理
· TypingService.swift — 54 KB,智能输入
· CommandModeService.swift — 38 KB,命令模式
· SettingsStore — 195 KB,十几个扩展点配置
🔒 隐私模型
✅ 默认状态:local-first
· 语音、音频、转录文本默认全部留在本机
· 零上传,零云端依赖,零数据外传
· Fluid Intelligence 模型完全本地运行
⚠️ 会上传数据的场景:用户显式开启了 OpenAI/Groq/自定义云端 provider 用于增强或改写时。
💡 绝不收集:语音、原始音频、转录文本、选中文本、提示词、AI 回复、终端命令、窗口标题、文件路径、剪贴板、键入内容。
匿名分析(PostHog)默认开启但可关闭:Settings → Share Anonymous Analytics。仅收集 app 版本、macOS 版本、低基数 feature flag。
FluidVoice 在一个"人人都在上云"的市场里选择了全本地——不是技术不行,是用户群不同。语音转文字的下一个战场不是"谁的识别率更高",是"谁的数据治理更干净"。
⚡ 性能数据
3,380x
实时因子
<100ms
感知延迟
3.7x
语音 vs 打字
24min
最长单次转录
· 实时因子最高 3,380x — 1 秒内可处理近 1 小时的语音
· 感知延迟 < 100ms — 快到感觉即时
· 说话速度是打字的 3.7 倍 — 口述 150 词/分钟 vs 打字 40 词/分钟
· 单次处理最长 24 分钟 — 无需手动分割长音频
· CoreML + Metal 实现 Apple Silicon 低延迟转录,保持电池效率
🌟 今日一句话总结
FluidVoice 在一个"人人都在上云"的市场里选择了全本地——
8 种模型选择权 + 本地优先架构 + 自适应语调 + 语音控制 Mac,
是合规场景和隐私敏感用户目前最好的 macOS 选择。
🔗 GitHub:github.com/altic-dev/FluidVoice
🔗 官网:altic.dev/fluid
🔗 Discord:discord.gg/VUPHaKSvYV
⚠️ 免责声明:本工具依赖境外公开数据源,部分平台在中国大陆需合规网络环境访问。本文仅作技术分析,不构成任何投资或商业决策建议。


