1. 安装与首次设置
| 下载哪个 | 体积 | 适合谁 |
|---|---|---|
Setup 安装包 Kaikou-<版本>-Setup-selfcontained.exe | 见下载页 | 推荐:双击安装,不需要管理员、不需要预装 .NET |
绿色版 …-win-x64-selfcontained.zip | 见下载页 | 解压即用 |
精简版 …-win-x64.zip | 见下载页 | 已装 .NET 8 桌面运行时的用户 |
当前最新版本号、各包体积与 SHA256 校验值以 官网下载页实际列出为准;历史版本仍保留在官网 download/ 目录。
首次启动会走四步引导,第 4 步是这一版新增的、也是最关键的一步:
2. 五分钟上手
- 确认托盘(右下角)有 Kaikou 图标 —— 说明应用已在后台运行。
- 把光标放进任意输入框:微信、Word、浏览器、代码编辑器都行。
- 按住右 Alt 说话,松开;文字会自动出现。
- 如果弹出候选面板,按 1–4 选一行,Enter 确认、Esc 取消。
- 想换热键:「设置 → 快捷键」。
3. 听写与插入
热键模式(五选一)
| 模式 | 怎么用 |
|---|---|
| 右 Alt 按住说话(默认) | 按住说,松开结束 |
| Ctrl 双击 / 右 Ctrl 双击 | 双击开始,再说一次或停顿后结束 |
| Fn 按住(笔记本) | 按住 Fn 说 |
| 自定义 | 自己录一个组合键(按住说话 / 按一下切换两种风格) |
松开热键之后,插入结果会被如实区分成三种情况——这一点比"永远显示成功"重要得多:
其它行为
- 中文等文本走"剪贴板 + Ctrl+V"插入,兼容性最好,并自动还原你原来的剪贴板内容;纯英文 / 数字 / 符号(v1.3.7 起,普通应用同样支持)改为逐字直打,不占用、不覆盖剪贴板。
- 方言纠正:「设置 → 快捷键 → 方言纠正」按需勾选 8 个方言区(胶辽 / 东北 / 中原 / 江淮 / 西南 / 吴 / 粤 / 闽,100+ 词条),识别结果里的方言同音词自动改成标准表达;默认按系统区域预选。
- 长文本自动分段插入,避免某些应用卡顿或吞字。
- 录音时有 HUD 悬浮窗(音量与状态);开始/结束/成功/失败各有提示音。
- 识别失败会给出可执行的下一步(例如"请检查麦克风是否被其它程序占用"),不是只说"失败了"。
4. 候选面板
识别完成后弹出四行候选:原文 / 润色 / 术语化 / Prompt。可用键盘完成全部操作。
5. AI 能力(自带 API Key)
| 能力 | 怎么用 |
|---|---|
| 填 Key | 「设置 → 产品模式」:内置 8 家供应商预设与可选模型;也可填任意 OpenAI 兼容端点。Key 存在 secrets.dat,用 Windows DPAPI 按当前用户加密 |
| 免费渠道 | 「设置 → 产品模式 → 免费渠道 · 注册即领 Key」(v1.3.7 起):列出厂商官方免费层(智谱 GLM、SiliconFlow),点按钮直达官网注册页;免费标识与注册入口由云端清单下发,缺省回退内置值 |
| 润色档位 | 轻档只修错别字标点;重写档可重组句式。可开启「高亮改动」:新增标绿、删除标红删除线 |
| 场景 | Prompt / Code / Shell / General 四种,按前台应用与内容自动适配提示词风格 |
| 术语表 | 「设置 → 快捷键 → 个人术语表」加词(正确写法=错法1,错法2#备注):字面别名 + 同音拼音两条路纠正;只在识别结果上生效,可关闭 |
| 自定义动作 | 把常用改写("翻成粤语""改成周报")存成自己的动作,出现在右键菜单「AI 动作 ▸」里 |
| 划词与右键 | 划词热键 Ctrl+Alt+K;或选中文字后右键弹出 Kaikou 菜单(含「AI 动作 ▸」)。可在托盘「输入方式 → 选中文字右键菜单」开关 |
| 失败时 | 给出可执行处置(重试 / 去设置查 Key / 改用本地改写),绝不把失败结果当成成功替换原文 |
6. 翻译与目标语言
入口在「设置 → 语音 → 输出语言(翻译目标)」,共 10 个选项: 不翻译(跟随输入)、英文、中文、日文、韩文、繁体中文、法文、德文、西班牙文、俄文。
7. 会议记录(Windows 版的看家功能)
不只是"语音转文字":从收音、分段、认人,到纪要、待办与导出,是一条完整的本地流水线。
一句一行,还是一段一行?(默认:一段一行)
同一个人连着说话时,相邻的句子会并成一段,板上一行就是一段话 —— 读起来是段落,而不是一堆碎句;导出与归档也跟着变整洁。
| 情况 | 结果 |
|---|---|
| 同一条轨 + 同一说话人 + 停顿 ≤3 秒 + 这一行还没打标记 | 并入上一行 |
| 换了说话人 / 停顿更久 / 上一行打了「重点·待办·决策」/ 单段超过 400 字 | 另起一行 |
| 麦克风(我)与系统声音(对方) | 永远分开 |
AI 整理全文纪要(把整场会交给 AI 通读)
会议板上两个"纪要"按钮,分工不同,别点错:
| 按钮 | 得到什么 |
|---|---|
| 生成纪要(规则版) | 不调用 AI:从段落里抽议题与待办,本质是**提纲** |
| AI 整理全文纪要 | 把整场会交给 AI 通读后**成文**:修错别字与口误、按议题分段、保留说话人、输出五段式专业纪要 |
- 长会自动分块(每块约 2500 字):先逐块整理(保留信息),再合并成**一份** —— 不会"每块各写一份纪要"。
- 结果**先弹预览窗**给你过一眼,里面可「复制到剪贴板」「另存为 Word / RTF / Markdown…」(v1.3.7 起 Word 与 RTF 为原生写出、零依赖、中文不乱码);不会直接覆盖会议板或剪贴板。
- 需要 API Key(BYOK)。实测:8 句合成会议 → 323 字纪要、**1.6 秒**,结构/说话人/待办/纠错全部到位。
开始与结束
- 托盘菜单 「开始会议记录 / 结束会议记录」(排在最前面);
- 会议记录板窗口里的按钮;
- 热键 Ctrl+Alt+M —— 若被其它程序占用,应用会自动退到 Ctrl+Alt+B,并把实际生效的组合显示在托盘与会议板里。
说话人分离
本地声纹聚类自动区分说话人(上限 6 人);会议板顶部有命名条,把「说话人 2」改成「张工」后, 板上的徽标、时间轴导出、纪要里的完整转写、搜索全部同步。 需要一次性下载声纹模型(约 27 MB);没装也能正常记录,只是不显示说话人。
会中即时标记
开会时给"刚说完的那一句"打标:Ctrl+Alt+1 重点 · 2 待办 · 3 决策 —— 立即落进会议板,并进入最终纪要。
不怕崩:增量落盘与恢复
会议转写按段增量落盘(去抖约 2.5 秒):进程崩了或忘记点结束也不会丢整场会。 下次启动会提示"已恢复会议草稿 N 段",恢复错了还能一键撤销。
会后 Whisper 精修(v1.3.7 起)
会议结束且录到音频时,应用会在后台用 Whisper 离线模型把整场录音重新转写一遍,
精修稿存到 %APPDATA%\Kaikou\refinements\。实时稿保持原样不动;
精修全程静默进行,失败也不会有任何打扰。
导出与归档
纪要支持 Word(.docx)/ RTF / Markdown(带时间轴与说话人)/ 纯文本 / 邮件草稿 导出 (v1.3.7 起 Word 与 RTF 为原生写出、零依赖、中文不乱码); 会议结束自动归档,历史里搜得到过去会议,也可载回会议板再导出。
批量导入音频文件
托盘「会议记录 → 批量导入音频文件…」可一次选多个录音
(.wav .mp3 .m4a .aac .wma .aiff .aif .flac),转成文字稿落进会议板;
不支持的文件会先筛掉并说明原因,多文件拼在同一条时间轴上。
8. 待办台账(跨会议)
期限表述会被解析:今天 / 明天 / 本周X / 下周X / M月D日 / N天内 …… 解析不出来就不猜(宁可漏提醒也不误报)。
9. 历史与搜索
托盘「工具 → 历史记录与搜索…」:保留最近 500 条,每条带来源应用、是否改写、耗时、字数。
10. 语音指令
听写时把这些整句说出来即可执行(会议模式下不生效):
| 说什么 | 效果 | 备注 |
|---|---|---|
| 换行 / 回车 / 新行 / 下一行 / 另起一行 | 在当前插入位置换行 | — |
| 撤销 / 撤销上一步 / 回退 | 等同于 Ctrl+Z | — |
| 删除上一句(多种说法) | 删掉刚插入的那一句 | — |
| 发送 / 发出去 / 提交 | 触发目标应用的发送 | 需要二次确认 |
11. 本地 API(给开发者的接口)
「设置 → 产品模式 → 本地 API」:默认关闭;开启后只绑 127.0.0.1(回环),
并且令牌鉴权(未配置令牌不放行,健康检查也要令牌)。
| 方法 | 路径 | 作用 |
|---|---|---|
| GET | /v1/health | 健康检查(带版本号) |
| GET | /v1/version | 同上(兼容别名) |
| POST | /v1/transcribe | 转写一段音频 |
| POST | /v1/polish | 按档位改写文本 |
| POST | /v1/minutes | 从文本整理纪要 |
| GET | /v1/history | 读历史记录 |
http://127.0.0.1:<端口>/ 有一个内置网页(含音频文件上传)。
「局域网访问」是另一个开关:开了之后同一网络的人都能访问,请只在你信任的网络里开。
12. 数据与模型:看清占用、导出诊断包
诊断包里有什么、没有什么
| ✅ 会放进去 | ⛔ 不会放进去 |
|---|---|
| 版本与运行环境、数据占用清单、模型状态 | secrets.dat(账号与 API Key 密钥库)—— 一个字节都不读 |
| 设置(密钥类字段已抹成占位符) | 会议归档与会议草稿(里面有你的会议内容) |
| AI 用量(本来只有类别与 token 数) | 模型与音效文件(体积大、可重新下载) |
| 日志尾部(手机号只留前 3 后 4,Key 一律抹掉) | — |
说明.txt 写清"放了什么 / 没放什么"。**你可以解开逐个看过再决定要不要发给我们。**
13. 设置页逐页说明
侧边栏顺序(Windows 版,v1.3.7 实际结构):
| 页面 | 主要内容 |
|---|---|
| 通用 | 开机自启(含"注册表里到底有没有"的状态行)、启动时最小化到托盘、外观(候选面板 / 录音悬浮窗)、版本与检查更新(含「打开下载页」) |
| 语音 | 识别引擎选择(SenseVoice 离线推荐)、输出语言(翻译目标)、SenseVoice 语言与模型管理、麦克风灵敏度 |
| 快捷键 | 热键模式与自定义热键、划词与右键菜单、文本处理、候选行配置(增删改 / 提示词 / 跳过 AI)、个人术语表(含术语参与识别纠正)、方言纠正(8 区勾选)、会议选项(系统声音 / 说话人分离 / 连续说话合并)、本地 API(开关 / 端口 / 局域网) |
| 产品模式(模式与 AI) | 额度与计费(BYOK 说明)、AI 供应商与 Key(内置 8 家 + 任意 OpenAI 兼容端点)、免费渠道 · 注册即领 Key、AI 功能开关 |
| 统计 | 今日与累计次数、字数、时长,语言分布,最近记录 |
| 数据与模型 | 占用清单、模型状态、脱敏诊断包、清理(见第 12 节) |
| 账号(可选) | 登录状态与账号信息。登录是可选的:不登录也能用全部功能 |
| 关于 | 版本号、应用 Logo、三段式软件名与功能标签(v1.3.7 起对齐 macOS 版关于页) |
14. 托盘菜单
右键托盘图标(每次弹出都会重建,所以显示的一定是最新状态):
15. 快捷键总表
| 功能 | 默认键 | 能否改 |
|---|---|---|
| 听写(按住说话) | 右 Alt 按住 | 能 |
| 划词润色 / 改写菜单 | Ctrl+Alt+K | 能 |
| 打开 / 聚焦会议记录板 | Ctrl+Alt+M(被占用时自动退到 Ctrl+Alt+B) | 能 |
| 会中标记:重点 / 待办 / 决策 | Ctrl+Alt+1 / 2 / 3 | 能 |
| 候选面板:选择 / 确认 / 取消 | 1–9·0 / Enter / Esc | 否 |
| 候选面板:多轮回退 | Alt+← · Alt+Shift+← | 否 |
| 语音指令(换行 / 撤销 / 删除上一句 / 发送) | 说出即可 | 否 |
16. 故障排查
| 症状 | 可能原因 | 怎么办 |
|---|---|---|
| 按热键完全没反应 | ① 离线模型没下载 ② 热键被别的程序占用 ③ 应用没在运行 | 看托盘是否有图标;「设置 → 语音」确认模型已下载;「设置 → 快捷键」换一个热键 |
| 提示"识别为空 / 没检测到语音" | 麦克风被占用、静音、设备选错 | 托盘「系统 → 重启麦克风采集」;检查 Windows 麦克风权限与默认设备 |
| 插入没反应 / 显示"已插入(未确认)" | 目标窗口读不到内容(浏览器/Electron/富文本) | 这是如实提示不是失败:看一眼是否已插入;没插进去就按 Ctrl+V(文字还在剪贴板里) |
| 选中文字后右键没有 Kaikou 菜单 | 托盘「输入方式 → 选中文字右键菜单」被关掉;或该程序不通过 UIA 报告选区 | 把开关勾上(默认开);或改用划词热键 Ctrl+Alt+K |
| 会议里对方的声音没出字 | 系统声音轨没开 / 设备不支持 loopback | 「设置 → 语音」打开"会议中采集系统声音";确认默认输出设备正常 |
| 会议板没显示说话人 | 声纹模型未下载 | 下载声纹模型(约 27 MB);没装不影响记录 |
| AI 润色一直失败 | Key 没填 / 额度用尽 / 网络不通 | 「设置 → 产品模式」检查 Key 与供应商;提示里会给出处置入口 |
| 内存占用高(约 2 GB) | 用的是 FP32 大模型 | 「设置 → 语音」换成 INT8:实测逐字一致、常驻约 650 MB |
| 下拉框点不开 | 旧版本(v1.2.1 及以前)的样式缺陷 | 升级到 v1.2.2 以后 |
| 想知道日志在哪 | — | %APPDATA%\Kaikou\kaikou_debug.log;更好的做法是导出脱敏诊断包 |
17. 隐私与数据
- 未配置更新源时,检查更新不会发起任何请求;启动时只拉一次公开的供应商清单(不含账号信息)。
- 卸载不删数据;数据目录位置与占用随时可在「数据与模型」页看到。
18. 与 macOS 版的差异
| macOS 版 | Windows 版 | |
|---|---|---|
| 获取 | Mac App Store | 官网下载安装包 / 绿色版 |
| 收费 | 基础免费 + 专业版/旗舰版订阅(Apple 处理) | 软件免费 + 自带 API Key:AI 费用付给厂商 |
| 识别引擎 | SenseVoice 离线 + Apple Speech | SenseVoice 离线(Windows 自带引擎在 .NET 8 下不可用) |
| 会议记录 | v1.1.0 起新增:会议记录、AI 纪要、会后 Whisper 精修、待办台账 | 完整闭环:双轨收音、说话人分离、即时标记、纪要、待办台账、归档、批量导入 |
| 本地 API | 有 | 有(6 个端点 + 内置网页) |
| 数据与模型页 | — | 有(占用清单 / 模型管理 / 脱敏诊断包 / 清理) |
| 登录 | 可选 | 可选(不登录也能用全部功能) |
19. 已知边界(如实告知)
- 安装包未做代码签名 → 首次运行 SmartScreen 会提示"未知发布者"。三步继续: ① 点提示框左侧「更多信息」② 点右下角「仍要运行」③ 正常安装。 这不是报毒,只是没有可验证的发布者身份;想核对完整性可用官方公布的 SHA256。 若安装包被 Windows"锁定"(从网上下载的文件会带这个标记):右键 → 属性 → 勾「解除锁定」。
- 首次必须下载约 239 MB 离线模型,否则听写与会议记录不可用。
- 个别窗口无法校验插入结果(浏览器 contenteditable / Electron / 富文本)→ 显示「已插入(未确认)」。
- Windows 自带语音识别在 .NET 8 下不可用 → 已禁用,不会让人切过去把自己弄哑。
- 更新检查默认指向官网版本清单(
https://www.17kaikou.com/update.json):启动 10 秒后查一次, 只有真有新版本才弹一次托盘气泡(含版本号、更新说明与 SHA256 前 8 位); 失败完全静默(只写日志);可用环境变量KAIKOU_UPDATE_URL=off显式关闭(离线 / 内网 / 排障)。 - 说话人分离是参考判定:同性别、远近场差异大时可能分错,可手动改名修正。
- 语音指令只支持整句(故意的,避免把正常说话的"换行"劈开)。
20. 获取帮助
报问题时请附上:
- 脱敏诊断包:「设置 → 数据与模型 → 一键导出脱敏诊断包」生成的 zip(可自行解开检查);
- 一句话说明:你当时在做什么、期望什么、实际发生了什么。
邮箱:support@17kaikou.com · 官网:www.17kaikou.com
docs/USER-GUIDE-WINDOWS.md(20 章、500 行)。