Windows 本地 AI 语音输入法 | Offline Speech-to-Text | 离线语音转文字
Aria 是一个 Windows 本地语音输入工具。基于 Qwen3-ASR,语音识别在本地完成。支持热词纠错、屏幕上下文感知、AI 语义纠错、三档润色风格、语音指令、语音截图等功能。
- 屏幕感知增强 — 说话时自动 OCR 读取当前屏幕内容,让 AI 理解你正在使用的场景,纠正人名、专业术语、医学/化学名词、3D/编程术语等同音错字
- 热词纠错 — 在热词表中添加你常用的专有名词、人名、术语,ASR 识别时自动偏向这些词,同音字错误通过拼音匹配自动纠正;屏幕反复出现的专名还可自动学习为热词(默认关闭,可在设置开启)
- 三档润色风格 — 逐字保真 / 顺畅口语 / 结构化文档,一键切换口述整理强度;对命令行口述自动保持单行并去除口头禅
- 三档收音模式 — 正常 / 嘈杂 / 轻语,悬浮球菜单一键切换:嘈杂环境强化拒噪,夜间小声说话自动增益
- 语音操作选区 — 选中文字后语音触发翻译、润色、总结、扩写、改写、AI 回复等操作,结果弹窗展示或直接替换
- 语音指令 — 在设置里统一管理唤醒词、内置指令和“我的语音指令”。说“唤醒词 + 指令短语”即可打开软件、文件夹、网页或 Windows 常用入口;常用预设可一键导入,近音匹配只作用于已配置的个人指令,不需要加入全局热词
- 语音截图 — 说一句话完成全屏 / 区域截图,自动存文件并复制到剪贴板,区域截图还能一键钉在桌面置顶
- 语音提醒和记录 — 语音设置定时提醒(如"提醒我五分钟后喝水"),语音记录想法和灵感
- 持续监听模式 — 按一次快捷键开启,Aria 持续监听并自动识别输入,再按一次关闭,无需按住说话
- 便携免安装 + 自动更新 — 解压即用,GPU 加速 / 无 GPU 自动回退 CPU;内置静默自动更新,升级自动保留个人配置与已下载模型
| 版本 | 大小 | 说明 | 链接 |
|---|---|---|---|
| 精简版 (Lite) | ~2 GB | 首次启动自动下载 ASR 模型 | GitHub Releases |
| 完整版 (Full) | ~6 GB | 内置 ASR 模型,解压即用(网盘包版本更新中,最新功能请优先使用精简版) | 百度网盘 提取码 34ti · 夸克网盘 |
- 下载并解压
- 双击
Aria.exe - 按
`(反引号键)开启语音输入 - 对着麦克风说话,文字自动输入到当前光标位置
- 再按一次
`关闭
Aria 不配置 API 也能离线输入;但如果你经常说人名、专业名词、代码/3D/医学/化学术语,建议开启 DeepSeek API 润色:
- 右键托盘图标 → 设置 → API
- 点击 一键填入 DeepSeek 推荐配置
- 粘贴你的 DeepSeek API Key
- 点击 测试主 API,成功后点击 保存 API 设置
- 在 高级设置 里确认 屏幕感知 已勾选,并勾选 屏幕感知增强(默认关闭,开启后术语纠错效果最佳)
开启后,Aria 会把当前屏幕 OCR 作为动态上下文交给 AI 润色层:例如屏幕在 Blender/医学病历/HPLC 方法页时,即使目标词没有逐字出现在屏幕上,也会根据场景和读音把“发现贴图”纠成“法线贴图”、把“甲安蝶令”纠成“甲氨蝶呤”。API 超时或失败时会自动回退,不影响基础输入。
git clone https://github.com/Xingxun7777/Aria.git
cd Aria
python -m venv .venv
.venv\Scripts\activate
pip install -r requirements.txt
copy config\hotwords.template.json config\hotwords.json
Aria_debug.bat- ASR 引擎 — 默认 Qwen3-ASR(支持 52 种语言),备用 FunASR(中文)
- GPU 自动适配 — 按显存自动选择 1.7B 全模型(约 5 GB+ 显存)或 0.6B 轻量模型;检测到显卡被游戏 / 渲染占用时自动改用 CPU 识别,不抢显卡
- 屏幕上下文 — 高质量模式把 OCR 交给 AI 润色层做柔性纠错;快速模式只把已缓存的低风险屏幕关键词交给 ASR,不等待 OCR
- 近期上下文 — 最近 10 条识别结果作为跨语段上下文,提升连续对话准确率
- 热词纠错 — 正则替换 + 拼音模糊匹配 + 可选 AI 润色,每个热词可设权重
- 实时字幕 — 说话时毛玻璃面板显示中间识别结果
- 噪声过滤 — 自动过滤环境噪声产生的无意义文字
- 三档润色风格 — 逐字保真(默认,只修错字标点)/ 顺畅口语(去口头禅、保留原话结构)/ 结构化文档(长段口述自动分段、整理列表),设置页一键切换
- 终端保护 — 检测到命令行 / 终端时自动保持单行输出并去除口头禅,不会触发意外命令
- 屏幕感知增强(可选,需配置 API)— 自动 OCR 当前屏幕,让模型先理解使用场景再纠正 ASR 原文,支持“屏幕没有直接出现目标词,但场景强相关”的专业术语纠错;不把屏幕文字硬塞进无关句子
- 屏幕识别策略三档 — 关闭 / 仅自动学习 / 开启 OCR,按需平衡纠错效果与 API 用量
- 支持个性化润色规则;高级用户可配置 GGUF 模型实现离线润色
- API 超时或失败时自动回退原文,不影响基础输入
选中文字后,说唤醒词 + 命令:
| 命令 | 效果 |
|---|---|
| 润色 / 优化 | 提升文字表达质量 |
| 翻译成英文 / 中文 / 日文 | 替换为对应语言翻译 |
| 扩写 / 展开 | 增加细节和深度 |
| 缩写 / 精简 | 保留核心信息 |
| 重写 / 改写 | 换种表达方式 |
| 什么意思 | 弹窗翻译(不替换原文) |
| 总结一下 | 弹窗显示摘要 |
| 帮我回复 | AI 生成回复建议 |
| 问 AI | 打开 AI 对话窗口 |
| 帮我打开 | 打开选中的路径或 URL |
| 记一下 + 内容 | 记录想法 |
| 提醒我 + 时间 + 内容 | 设置定时提醒 |
弹窗支持拖拽移动、固定、一键复制、一键插入。
| 命令 | 效果 |
|---|---|
| [唤醒词] 开启/关闭自动发送 | 控制识别后是否自动按回车 |
| [唤醒词] 休眠 / 醒来 | 暂停/恢复语音监听 |
| [唤醒词] 深度休眠 | 卸载 ASR 模型,释放显存 |
| [唤醒词] 发送/删除/复制/粘贴/保存 | 对当前窗口发送常用快捷键 |
| [唤醒词] 截图 / 截屏 | 全屏截图,存文件并复制到剪贴板 |
| [唤醒词] 区域截图 | 框选截图,工具栏可一键钉在桌面(置顶贴图) |
| [唤醒词] + 我的语音指令 | 执行设置中的个人启动指令,如「小助手打开我的电脑」 |
唤醒词、内置指令指南和我的语音指令可在 设置 → 语音指令 中统一查看/配置。页面提供“我的电脑、资源管理器、下载文件夹、系统/声音设置、计算器、记事本、截图工具”等常用预设;预设只有导入并保存后才会生效,不会污染全局识别热词。
- 所有语音输入、翻译、润色结果自动存储
- 历史浏览器:按日期、类型、关键词查找
- 支持导出为 Markdown
- 自动清理过期记录(默认 90 天)
- 三档收音模式 — 正常 / 嘈杂 / 轻语(悬浮球菜单切换),麦克风音量可调并按模式分别记忆
- 备用 API 轮询 — 配置主/备 API,连续慢响应自动切换,悬浮球菜单实时显示当前线路
- 用量统计 — 设置页可视化展示 API 调用次数、token 用量与估算费用
- 自动更新 — 后台静默检查下载、校验后重启换入,升级自动保留个人配置、历史数据与已下载模型
- 管理员快捷方式 — 高权限程序注册后可免 UAC 语音启动(设置中注册,含风险提示)
- Typewriter 模式 — 逐字输入,兼容游戏和管理员权限应用
- 配置热重载 — 修改配置后自动生效,无需重启
- 开机自启 — 注册表方式,支持便携模式
- HF 镜像 — 中国用户默认使用 hf-mirror.com 下载模型
| 项目 | 最低 | 推荐 |
|---|---|---|
| 操作系统 | Windows 10 64 位 | Windows 11 |
| Python | 3.12 | 3.12 |
| 内存 | 8 GB | 16 GB |
| 显卡 | 无(CPU 可用) | NVIDIA GTX 16xx+(4 GB 显存) |
内置 CUDA 12.8 的 PyTorch,无兼容 GPU 时自动回退 CPU 模式。
GPU 兼容性详情
| GPU 系列 | 架构 | 支持 |
|---|---|---|
| RTX 40xx / 50xx | Ada / Blackwell | 完全支持 |
| RTX 30xx | Ampere | 完全支持 |
| RTX 20xx / GTX 16xx | Turing | 支持 |
| GTX 10xx | Pascal | 自动 CPU 回退 |
| 无 NVIDIA GPU | — | CPU 模式 |
配置文件:config/hotwords.json(首次运行自动从模板创建,保存后自动热重载)。
常用配置项:
| 字段 | 说明 | 默认值 |
|---|---|---|
asr_engine |
识别引擎 | qwen3 |
general.hotkey |
全局热键 | ` |
polish_style |
润色风格(verbatim 逐字保真 / smooth 顺畅口语 / structured 结构化) |
verbatim |
polish_mode |
润色模式(配置 API Key 并开启后才生效) | quality |
polish.api_url |
API 地址 | https://api.deepseek.com |
polish.model |
API 模型 | deepseek-chat |
vad.screen_ocr |
屏幕感知 | true |
vad.screen_ocr_polish |
屏幕感知增强(需 API) | false |
vad.screen_ocr_use_dml |
启用 DirectML OCR 加速(独立进程隔离) | true |
vad.screen_ocr_force_cpu |
强制 CPU OCR(诊断用) | false |
vad.threshold |
VAD 灵敏度 (0-1) | 0.15 |
audio.capture_mode |
收音模式(standard 正常 / noisy 嘈杂 / whisper 轻语) |
standard |
output.typewriter_mode |
逐字输入模式 | false |
Aria 默认完全离线运行,不调用任何 API;配置 API Key 并开启润色后才会联网。更多配置项可直接在「设置」界面调整,每一项都有悬停说明。
识别准确率不高?
- 添加专有名词到
hotwords列表,设置合适权重 - 配置
replacements替换规则处理固定误识别 - 填写
domain_context描述使用场景(如 "编程技术讨论") - 启用 API 润色(设置 → API → 一键填入 DeepSeek 推荐配置 → 填 API Key)
- 开启屏幕感知增强(
vad.screen_ocr_polish: true,默认关闭,需先配置 API)
GPU 加速不工作?
- 确认
nvidia-smi正常运行 - GTX 16xx 及以上自动启用,10xx 及更旧自动回退 CPU
- 显存约 5 GB 以上自动选用 1.7B 全模型,更低显存自动用 0.6B 轻量模型(热词与上下文纠错仍然生效)
- 更新显卡驱动到最新版本
无法在某些应用输入文字?
- 启用 Typewriter 模式:
output.typewriter_mode: true - 如目标程序以管理员运行,以管理员启动 Aria
首次启动很慢?
- 精简版:首次使用需自动下载 ASR 模型(约 1.2-3.4 GB),下载后离线可用
- 完整版:已内置模型,解压即用
- 也可在设置中切换到 FunASR 备用引擎
环境噪声导致误输入?
- 悬浮球菜单把收音模式切到「嘈杂」(强化拒噪)
- 适当提高 VAD 阈值(
vad.threshold,默认 0.15,嘈杂环境可调至 0.4) - 适当提高能量阈值(
vad.energy_threshold,默认 0.003)
展开查看
Aria/
├── launcher.py # 入口:单例检查 + 启动画面 + 模型预加载
├── app.py # 主应用:状态机 + ASR 编排
├── core/ # 核心模块
│ ├── asr/ # 语音识别引擎
│ ├── audio/ # 音频捕获 + VAD
│ ├── context/ # 屏幕上下文感知 + OCR
│ ├── history/ # 历史记录存储
│ ├── hotword/ # 热词纠错 + AI 润色
│ ├── screenshot/ # 截图、贴图与保存
│ ├── selection/ # 选区指令
│ ├── wakeword/ # 唤醒词检测 + 命令执行
│ └── command/ # 语音键盘命令
├── ui/qt/ # PySide6 界面
├── system/ # 系统集成(热键、文本输出、权限检测)
└── config/ # 配置文件
| 项目 | 许可证 | 说明 |
|---|---|---|
| Qwen3-ASR | Apache 2.0 | 通义千问语音识别 |
| FunASR | MIT | 阿里达摩院语音识别 |
| Silero-VAD | MIT | 语音活动检测 |
| PySide6 | LGPL v3 | Qt6 Python 绑定 |
| PyTorch | BSD-3-Clause | 深度学习框架 |
| pypinyin | MIT | 汉字拼音转换 |
| RapidOCR | Apache 2.0 | PP-OCRv5 ONNX 推理 |