更新日志
2.0.0-beta.9
转录稿可以改了。 在录音详情里双击任意一句,就能改错字、改译文、把一句拆成两句、与下一句合并, 或微调它的起止时间。全程支持撤销/重做,「恢复原始转录」随时能把模型最初的输出原样找回来—— 你的修改是叠在原文之上、而不是替换掉它,所以重新翻译永远不会冲掉你手改过的措辞。
首次启动有了引导。 全新安装会先走一段简短的设置:按你的语言和机器推荐一个转录模型、下载它, 然后用一小段内置音频跑一次转录来验证——让你在真正开始录之前就知道模型能用,而不是在第一次录音时 才发现不行。权限只问你选的用途真正需要的那几项;只转录文件的话,一项都不问。
文件转录与听写更准了。 当模型自己就能切分音频时,不再先把音频切碎再喂给它。在会议音频上实测, 我们发布的四个引擎全部提升约 3~6 个点,而且更快。听写受益最大:以前会返回空结果的短句,现在能 正常转出来。
日语模型换了一个好得多的。 新增并推荐一个日语专用模型,错误率相比此前的推荐大约减半。
修复:Parakeet TDT v3 被错误标注为支持日语。 它并不支持——喂日语会输出胡话。现在只列出它 真正能处理的语言。
下载更小、兼容更广。 Whisper/SenseVoice 的辅助组件改为从源码编译:体积约减半,也不再是 那个逼着整个应用要求更高 macOS 版本的组件。
2.0.0-beta.8
下载体积更小。 打包清理去掉了一大批无需随包发布的代码,下载和占用明显变小——功能没有变化。
底层安全加固。 界面改用一个私有、自包含的协议加载(不再走本地文件),应用也以更收紧的系统权限 运行。外观没有任何变化,这只是缩小了应用的受攻击面。
少量显示偏好会一次性重置。 作为上面改动的副作用,几项存在本机的界面偏好——字幕字号、背景不透明度、 双语/仅译文模式、界面语言、以及资料库阅读面板的布局——会在你第一次打开这一版时恢复默认一次。你的 录音、转录、模型和设置都不受影响。
2.0.0-beta.7
现在需要 macOS 13(Ventura)或更高版本。 Whisper 转录模型换用了更新、更快的引擎,它需要 macOS 13。如果你还在 macOS 12,请先留在 beta.6,等系统升级后再更新——你不会被自动推送到这一版。
Whisper 转录换用更新的引擎。 内置的 Whisper 模型现在与其它语音模型用同一套更新的引擎,替换掉了 应用内一个较旧的版本。
修复:启动瞬间应用可能卡住、光标一直转。 启动不再在主线程做重活,窗口一出现就能响应。
修复:更新的「重启并安装」现在第一次就能装上。 以前有时会不安装、应用还留在后台,得先手动退出才行。
实时字幕保持易读的长度。 持续说话很久时,Parakeet Realtime 现在会到一定长度就收尾,而不是让一条 字幕无限变长——更好读、也更方便翻译。可在 设置 → 高级 里调整或关闭;旁边还有 macOS 26 上 Apple Speech 的低延迟开关。
菜单整理。 「关于 AIHear」和「检查更新」现在会打开应用内的关于页(版本、许可证、更新入口),不再点了没反应。
2.0.0-beta.6
修复:新的实时模型无法下载。 beta.5 里 Parakeet Realtime 模型报校验错误、装不上,实时字幕 因此完全用不了。现在能正常下载和运行。
修复:启动后有一下卡顿。 启动不再被一个后台任务阻塞,窗口一出现就能响应。
修复:设置了代理时检查更新失败。 检查更新现在会走你配置的代理,与应用内的连接测试用的是同一个。
新增:菜单栏里的「检查更新」。 现在可以从 AIHear 菜单直接检查,不必再进 设置 → 关于。
所有语音模型都会列出,包括当前 Mac 还跑不动的。 每个会标注所需的 macOS 版本(比如 Apple 内置 的实时引擎会显示「需要 macOS 26」),让你看得到有哪些能力、需要什么条件。你的系统支持的模型用法不变。
2.0.0-beta.5
边说边出的实时字幕。 新增实时识别模式:话音一落字就出,而且一句说完就定稿、不再反复改写—— 不再闪烁。Parakeet Realtime(英文)在 macOS 14 及以上可用;macOS 26 上还内置了一个 Apple 引擎, 把同样的实时体验带给更多语言(含中文),且无需下载模型。原有语音模型不受影响,照常可用。
告诉识别你在说哪种语言,还能引导它。 Whisper 与 Qwen3-ASR 现在可以设置音频语言,并用一小段 提示词引导识别——比如让它偏向简体或繁体中文。一键建议会替你填入合适的提示词,完整提示词在设置里 编辑。用不到这些选项的引擎不会显示它们。
想什么时候查更新、什么时候装,都由你定。 新增「检查更新」按钮;有新版本时,由你决定何时安装, 而不是退出时自动装上。这也修复了「更新下好了却始终装不上」的情况。
播放与查找修复。 录音里拖动进度现在稳定可用;悬浮字幕窗首次出现在屏幕底部居中;跟随播放滚动 也不再把你正在看的查找结果拽走。
其余改动都在底层,不影响日常使用。
2.0.0-beta.4
修复:macOS 12、13、14 上的离线翻译与 AI 总结从来就没能用过。 内置的本地模型服务启动即崩溃, 每一次翻译、每一个 AI 动作都失败,而你只会看到一句「翻译失败」,看不出任何原因。原因是它被按比 AI Hear 支持范围更高的 macOS 版本编译。现在已重新编译,在所有受支持的系统版本上都能正常运行。 macOS 15 及以上从不受此影响,也没有变化。
需要更高 macOS 的语音模型,不再向跑不动它们的系统提供。 Parakeet 与 Qwen3-ASR 需要 macOS 14, SenseVoice 需要 macOS 13。此前你可以把它们下下来——483 MB 到 1.6 GB——下完才发现根本起不来。 现在它们在跑不动的系统上不再显示。Whisper 系列不受影响,在所有受支持的版本上照常可用。
其余改动都在底层,不影响日常使用。
2.0.0-beta.3
自动更新开始生效。 从这一版起,AI Hear 会自己检查新版本,并在退出时静默安装——不用再回来手动 下载了。(beta.1 用户:这一次还需要手动下载,之后就顺了。)
更多安全加固。 第二轮安全审计:内部源码和构建路径不再随应用分发;即便界面被恶意代码控制,已保存的 API Key 也无法被转发到其它服务器;文件转录只接受真正的媒体文件,不接受任意路径;应用也不再声明它 从不使用的摄像头、蓝牙权限。
其余改动都在底层,不影响日常使用。
2.0.0-beta.2
需要 macOS 12(Monterey)或更高版本。 AI Hear 内置的浏览器引擎升级到了仍在接受安全修复的版本, 它不再支持 macOS 11。如果你还在 macOS 11,请先留在 beta.1,等系统升级后再更新。
你的 API Key 从此「只写不读」。 已保存的 Key 只显示掩码(••••••1234),可以覆盖,但读不回来——
设置页读不到,界面里跑的任何东西也读不到。Key 始终加密存在系统钥匙串里,不会离开应用核心。
安全加固。 一轮安全审计的修复:界面层不再能越过应用自身的边界;出站请求收紧(明文 http://
现在只允许连本机,供本地模型服务使用);打包版一律忽略开发者用的环境变量覆盖。
修复:API Key 可能被永久删除。 如果 macOS 弹出钥匙串授权框而你点了「不允许」——换新 Mac 之后 就可能遇到——你保存的所有 Provider Key 会被静默清空。现在它们会被完整保留;点了拒绝只意味着 这次开机用不了该 Provider,允许访问并重启后即恢复。
2.0
2.0 是一次重写,不是一次升级。1.x 是一个「实时字幕悬浮窗」;2.0 在此之上多了听写、文件转录、媒体库和本地 AI——录下来的东西不再随窗口关闭而消失。
全新
媒体库. 每一次实时字幕、听写、文件转录都会入库。可搜索、按日期分组、批量导出或删除。详情页是为「精听」造的:句级跳转、单句循环、A-B 循环、变速、页内查找。
听写. 全局快捷键(或双击 Shift)在任意应用里录一段话,转成文字直接粘贴到光标处。可以指定听写专用的模型,也可以挂一个 AI 后处理动作(例如「润色」「润色并翻译」)——粘贴出来的就是处理过的文本。
文件转录. 把音视频文件拖进来离线转录。解码用随包的 ffmpeg,支持常见的音视频格式。
AI 动作与追问. 对任意一条录音跑总结、要点、待办、会议纪要、润色。结果与追问同在一条对话流里,流式输出、Markdown 渲染、历史随录音持久化。
本地 AI(离线翻译与总结). 内置 llama.cpp 与 Qwen3 权重,翻译和 AI 动作无需任何 API Key、不联网即可使用。
Apple 端侧翻译(macOS)。走系统的翻译框架,同样不出网。
变化
语音识别引擎. 1.x 只有 whisper.cpp。2.0 还提供 SenseVoice、Qwen3-ASR(Apple 芯片走 MLX 加速)、Parakeet,并且实时字幕与文件转录各自记住自己的活跃模型——实时可以用小模型保延迟,文件转录换大模型保准确率。
音频. 1.x 只能选一个音频来源。2.0 麦克风与系统音是两条可同时开启的轨,各有独立增益,真混音;系统音还可以只抓某个 App 窗口或某块显示器。
翻译. 1.x 的 Microsoft / Bing / Google 引擎已移除,改为 Apple 端侧翻译、内置本地模型,或任意 OpenAI 兼容的服务商。目标语言扩到 60 多门,选择器可搜索,也支持表里没有的自定义语言。新增「润色」——目标语言与原文相同时,只修标点、去口水词,不翻译。
界面. 深浅色主题、系统强调色、原生菜单栏与托盘、原生确认对话框。界面语言从中英扩到英文、简体中文、繁體中文、日本語、한국어五种。
存储. 录音统一存为 Opus,体积约为 WAV 的 1/8。设置页可以看到模型、录音、日志、缓存各占多少,并一键清理日志与缓存。
隐私. 2.0 不采集任何遥测。音频永不出网;只有你主动配置了云端 AI 服务商时,转录文本才会发给你指定的那家。崩溃上报默认关闭,可在「设置 → 高级」自行开启(开启后仅在崩溃时发送错误堆栈与版本信息,不含音频、转录内容或 API Key)。详见隐私政策。
暂未回归的 1.x 功能
我们记着这些,只是还没做:
- 字幕字体颜色——2.0 目前只能调字号与背景不透明度
- 音频源语言手选——2.0 由引擎自动检测
- 指定 GPU(1.x 的 Windows 多显卡选项)
- 局域网字幕服务(1.x 定制版的 SSE + 二维码)
- SOCKS 代理——2.0 的代理只支持 HTTP(S)
如果其中某一项对你是刚需,告诉我们,它会往前排。