Skip to content

Xingxun7777/Aria

Repository files navigation

Aria — Local AI Voice Typing for Windows

Windows 本地 AI 语音输入法 | Offline Speech-to-Text | 离线语音转文字

Version License Platform Python

下载 · 快速开始 · 功能介绍 · 配置说明 · 常见问题


Aria 是一个 Windows 本地语音输入工具。基于 Qwen3-ASR,语音识别在本地完成。支持热词纠错、屏幕上下文感知、AI 语义纠错、三档润色风格、语音指令、语音截图等功能。

特点

  • 屏幕感知增强 — 说话时自动 OCR 读取当前屏幕内容,让 AI 理解你正在使用的场景,纠正人名、专业术语、医学/化学名词、3D/编程术语等同音错字
  • 热词纠错 — 在热词表中添加你常用的专有名词、人名、术语,ASR 识别时自动偏向这些词,同音字错误通过拼音匹配自动纠正;屏幕反复出现的专名还可自动学习为热词(默认关闭,可在设置开启)
  • 三档润色风格 — 逐字保真 / 顺畅口语 / 结构化文档,一键切换口述整理强度;对命令行口述自动保持单行并去除口头禅
  • 三档收音模式 — 正常 / 嘈杂 / 轻语,悬浮球菜单一键切换:嘈杂环境强化拒噪,夜间小声说话自动增益
  • 语音操作选区 — 选中文字后语音触发翻译、润色、总结、扩写、改写、AI 回复等操作,结果弹窗展示或直接替换
  • 语音指令 — 在设置里统一管理唤醒词、内置指令和“我的语音指令”。说“唤醒词 + 指令短语”即可打开软件、文件夹、网页或 Windows 常用入口;常用预设可一键导入,近音匹配只作用于已配置的个人指令,不需要加入全局热词
  • 语音截图 — 说一句话完成全屏 / 区域截图,自动存文件并复制到剪贴板,区域截图还能一键钉在桌面置顶
  • 语音提醒和记录 — 语音设置定时提醒(如"提醒我五分钟后喝水"),语音记录想法和灵感
  • 持续监听模式 — 按一次快捷键开启,Aria 持续监听并自动识别输入,再按一次关闭,无需按住说话
  • 便携免安装 + 自动更新 — 解压即用,GPU 加速 / 无 GPU 自动回退 CPU;内置静默自动更新,升级自动保留个人配置与已下载模型

下载

版本 大小 说明 链接
精简版 (Lite) ~2 GB 首次启动自动下载 ASR 模型 GitHub Releases
完整版 (Full) ~6 GB 内置 ASR 模型,解压即用(网盘包版本更新中,最新功能请优先使用精简版) 百度网盘 提取码 34ti · 夸克网盘

快速开始

  1. 下载并解压
  2. 双击 Aria.exe
  3. `(反引号键)开启语音输入
  4. 对着麦克风说话,文字自动输入到当前光标位置
  5. 再按一次 ` 关闭

推荐:3 分钟开启高质量模式

Aria 不配置 API 也能离线输入;但如果你经常说人名、专业名词、代码/3D/医学/化学术语,建议开启 DeepSeek API 润色:

  1. 右键托盘图标 → 设置API
  2. 点击 一键填入 DeepSeek 推荐配置
  3. 粘贴你的 DeepSeek API Key
  4. 点击 测试主 API,成功后点击 保存 API 设置
  5. 高级设置 里确认 屏幕感知 已勾选,并勾选 屏幕感知增强(默认关闭,开启后术语纠错效果最佳)

开启后,Aria 会把当前屏幕 OCR 作为动态上下文交给 AI 润色层:例如屏幕在 Blender/医学病历/HPLC 方法页时,即使目标词没有逐字出现在屏幕上,也会根据场景和读音把“发现贴图”纠成“法线贴图”、把“甲安蝶令”纠成“甲氨蝶呤”。API 超时或失败时会自动回退,不影响基础输入。

从源码运行

git clone https://github.com/Xingxun7777/Aria.git
cd Aria
python -m venv .venv
.venv\Scripts\activate
pip install -r requirements.txt
copy config\hotwords.template.json config\hotwords.json
Aria_debug.bat

功能介绍

语音识别

  • ASR 引擎 — 默认 Qwen3-ASR(支持 52 种语言),备用 FunASR(中文)
  • GPU 自动适配 — 按显存自动选择 1.7B 全模型(约 5 GB+ 显存)或 0.6B 轻量模型;检测到显卡被游戏 / 渲染占用时自动改用 CPU 识别,不抢显卡
  • 屏幕上下文 — 高质量模式把 OCR 交给 AI 润色层做柔性纠错;快速模式只把已缓存的低风险屏幕关键词交给 ASR,不等待 OCR
  • 近期上下文 — 最近 10 条识别结果作为跨语段上下文,提升连续对话准确率
  • 热词纠错 — 正则替换 + 拼音模糊匹配 + 可选 AI 润色,每个热词可设权重
  • 实时字幕 — 说话时毛玻璃面板显示中间识别结果
  • 噪声过滤 — 自动过滤环境噪声产生的无意义文字

智能润色

  • 三档润色风格 — 逐字保真(默认,只修错字标点)/ 顺畅口语(去口头禅、保留原话结构)/ 结构化文档(长段口述自动分段、整理列表),设置页一键切换
  • 终端保护 — 检测到命令行 / 终端时自动保持单行输出并去除口头禅,不会触发意外命令
  • 屏幕感知增强(可选,需配置 API)— 自动 OCR 当前屏幕,让模型先理解使用场景再纠正 ASR 原文,支持“屏幕没有直接出现目标词,但场景强相关”的专业术语纠错;不把屏幕文字硬塞进无关句子
  • 屏幕识别策略三档 — 关闭 / 仅自动学习 / 开启 OCR,按需平衡纠错效果与 API 用量
  • 支持个性化润色规则;高级用户可配置 GGUF 模型实现离线润色
  • API 超时或失败时自动回退原文,不影响基础输入

选区指令

选中文字后,说唤醒词 + 命令:

命令 效果
润色 / 优化 提升文字表达质量
翻译成英文 / 中文 / 日文 替换为对应语言翻译
扩写 / 展开 增加细节和深度
缩写 / 精简 保留核心信息
重写 / 改写 换种表达方式
什么意思 弹窗翻译(不替换原文)
总结一下 弹窗显示摘要
帮我回复 AI 生成回复建议
问 AI 打开 AI 对话窗口
帮我打开 打开选中的路径或 URL
记一下 + 内容 记录想法
提醒我 + 时间 + 内容 设置定时提醒

弹窗支持拖拽移动、固定、一键复制、一键插入。

唤醒词控制

命令 效果
[唤醒词] 开启/关闭自动发送 控制识别后是否自动按回车
[唤醒词] 休眠 / 醒来 暂停/恢复语音监听
[唤醒词] 深度休眠 卸载 ASR 模型,释放显存
[唤醒词] 发送/删除/复制/粘贴/保存 对当前窗口发送常用快捷键
[唤醒词] 截图 / 截屏 全屏截图,存文件并复制到剪贴板
[唤醒词] 区域截图 框选截图,工具栏可一键钉在桌面(置顶贴图)
[唤醒词] + 我的语音指令 执行设置中的个人启动指令,如「小助手打开我的电脑」

唤醒词、内置指令指南和我的语音指令可在 设置 → 语音指令 中统一查看/配置。页面提供“我的电脑、资源管理器、下载文件夹、系统/声音设置、计算器、记事本、截图工具”等常用预设;预设只有导入并保存后才会生效,不会污染全局识别热词。

历史记录

  • 所有语音输入、翻译、润色结果自动存储
  • 历史浏览器:按日期、类型、关键词查找
  • 支持导出为 Markdown
  • 自动清理过期记录(默认 90 天)

其他

  • 三档收音模式 — 正常 / 嘈杂 / 轻语(悬浮球菜单切换),麦克风音量可调并按模式分别记忆
  • 备用 API 轮询 — 配置主/备 API,连续慢响应自动切换,悬浮球菜单实时显示当前线路
  • 用量统计 — 设置页可视化展示 API 调用次数、token 用量与估算费用
  • 自动更新 — 后台静默检查下载、校验后重启换入,升级自动保留个人配置、历史数据与已下载模型
  • 管理员快捷方式 — 高权限程序注册后可免 UAC 语音启动(设置中注册,含风险提示)
  • Typewriter 模式 — 逐字输入,兼容游戏和管理员权限应用
  • 配置热重载 — 修改配置后自动生效,无需重启
  • 开机自启 — 注册表方式,支持便携模式
  • HF 镜像 — 中国用户默认使用 hf-mirror.com 下载模型

系统要求

项目 最低 推荐
操作系统 Windows 10 64 位 Windows 11
Python 3.12 3.12
内存 8 GB 16 GB
显卡 无(CPU 可用) NVIDIA GTX 16xx+(4 GB 显存)

内置 CUDA 12.8 的 PyTorch,无兼容 GPU 时自动回退 CPU 模式。

GPU 兼容性详情
GPU 系列 架构 支持
RTX 40xx / 50xx Ada / Blackwell 完全支持
RTX 30xx Ampere 完全支持
RTX 20xx / GTX 16xx Turing 支持
GTX 10xx Pascal 自动 CPU 回退
无 NVIDIA GPU CPU 模式

配置

配置文件:config/hotwords.json(首次运行自动从模板创建,保存后自动热重载)。

常用配置项:

字段 说明 默认值
asr_engine 识别引擎 qwen3
general.hotkey 全局热键 `
polish_style 润色风格(verbatim 逐字保真 / smooth 顺畅口语 / structured 结构化) verbatim
polish_mode 润色模式(配置 API Key 并开启后才生效) quality
polish.api_url API 地址 https://api.deepseek.com
polish.model API 模型 deepseek-chat
vad.screen_ocr 屏幕感知 true
vad.screen_ocr_polish 屏幕感知增强(需 API) false
vad.screen_ocr_use_dml 启用 DirectML OCR 加速(独立进程隔离) true
vad.screen_ocr_force_cpu 强制 CPU OCR(诊断用) false
vad.threshold VAD 灵敏度 (0-1) 0.15
audio.capture_mode 收音模式(standard 正常 / noisy 嘈杂 / whisper 轻语) standard
output.typewriter_mode 逐字输入模式 false

Aria 默认完全离线运行,不调用任何 API;配置 API Key 并开启润色后才会联网。更多配置项可直接在「设置」界面调整,每一项都有悬停说明。

常见问题

识别准确率不高?
  1. 添加专有名词到 hotwords 列表,设置合适权重
  2. 配置 replacements 替换规则处理固定误识别
  3. 填写 domain_context 描述使用场景(如 "编程技术讨论")
  4. 启用 API 润色(设置 → API → 一键填入 DeepSeek 推荐配置 → 填 API Key)
  5. 开启屏幕感知增强(vad.screen_ocr_polish: true,默认关闭,需先配置 API)
GPU 加速不工作?
  1. 确认 nvidia-smi 正常运行
  2. GTX 16xx 及以上自动启用,10xx 及更旧自动回退 CPU
  3. 显存约 5 GB 以上自动选用 1.7B 全模型,更低显存自动用 0.6B 轻量模型(热词与上下文纠错仍然生效)
  4. 更新显卡驱动到最新版本
无法在某些应用输入文字?
  1. 启用 Typewriter 模式:output.typewriter_mode: true
  2. 如目标程序以管理员运行,以管理员启动 Aria
首次启动很慢?
  • 精简版:首次使用需自动下载 ASR 模型(约 1.2-3.4 GB),下载后离线可用
  • 完整版:已内置模型,解压即用
  • 也可在设置中切换到 FunASR 备用引擎
环境噪声导致误输入?
  1. 悬浮球菜单把收音模式切到「嘈杂」(强化拒噪)
  2. 适当提高 VAD 阈值(vad.threshold,默认 0.15,嘈杂环境可调至 0.4)
  3. 适当提高能量阈值(vad.energy_threshold,默认 0.003)

项目结构

展开查看
Aria/
├── launcher.py              # 入口:单例检查 + 启动画面 + 模型预加载
├── app.py                   # 主应用:状态机 + ASR 编排
├── core/                    # 核心模块
│   ├── asr/                 # 语音识别引擎
│   ├── audio/               # 音频捕获 + VAD
│   ├── context/             # 屏幕上下文感知 + OCR
│   ├── history/             # 历史记录存储
│   ├── hotword/             # 热词纠错 + AI 润色
│   ├── screenshot/          # 截图、贴图与保存
│   ├── selection/           # 选区指令
│   ├── wakeword/            # 唤醒词检测 + 命令执行
│   └── command/             # 语音键盘命令
├── ui/qt/                   # PySide6 界面
├── system/                  # 系统集成(热键、文本输出、权限检测)
└── config/                  # 配置文件

许可证

Apache License 2.0

致谢

项目 许可证 说明
Qwen3-ASR Apache 2.0 通义千问语音识别
FunASR MIT 阿里达摩院语音识别
Silero-VAD MIT 语音活动检测
PySide6 LGPL v3 Qt6 Python 绑定
PyTorch BSD-3-Clause 深度学习框架
pypinyin MIT 汉字拼音转换
RapidOCR Apache 2.0 PP-OCRv5 ONNX 推理

About

Windows 本地 AI 语音输入法 — 离线语音识别,屏幕感知上下文,热词纠错,语音指令操作选区。Local AI voice typing for Windows — offline speech-to-text with screen-aware context.

Topics

Resources

Stars

Watchers

Forks

Releases

Packages

Contributors

Languages