使用指南
听觉与麦克风
开了听觉以后,麦克风的声音经过哪里、存在哪里、谁能拿到。
听觉默认关闭。在 控制 → 声音 → 听你说话 打开后,ta 能听见你说话。这一页讲声音从麦克风到 ta 的每一步。
#打开之前
- 需要一把 Azure 语音的密钥,在 控制 → 声音 里填。识别和 ta 说话用同一把;没有密钥,听觉开不了。
- 安卓上要允许 App 使用麦克风。App 在后台用麦克风时,系统会显示一条常驻通知。
#声音走过哪些地方
- 在设备上断句。 控制台 App(电脑上是桌面版控制台)开着麦克风,在本机用语音活动检测(WebRTC VAD)判断有没有人在说话。没人说话时,什么都不发出去。
- 一句话送到运行基座。 检测到有人说话,这一段声音才送到运行基座。运行基座通常就在同一台设备上。
- 用你的 Azure 密钥识别成文字。 运行基座把这段声音发给 Azure 语音识别,用的是你自己的密钥和区域。
- ta 判断是不是在跟 ta 说话。 识别出的文字作为「听到的话」进入对话,由 ta 判断是不是对 ta 说的。不是,就不回应,这句话在对话里隐藏。
#存在哪里
- 麦克风的声音不存盘,识别完就丢掉。
- 识别出的文字存在设备上的对话记录里,和打字的对话一样;也和其他对话一样,会发给你选的模型供应商。ta 也可能像对待别的对话一样,把听到的事记进记忆。
- 几部手机同时听到同一句话时,它们之间经加密连接交换这句话的文字和时间,只留一份。
- ta 自己说话的声音(语音合成的结果)存在设备上,只留最近 50 段。
#谁能拿到什么
| 谁 | 拿到什么 |
|---|---|
| Azure 语音(你自己的账号) | 检测到有人说话的那几段声音 |
| 你选的模型供应商 | 识别出的文字 |
| 同步服务、GitHub | 拿不到声音,也拿不到识别出的文字 |
#什么时候不听
- 急停中;电量低于预算里设的下限且没在充电;温度过高。
- 电脑上 ta 说话的时候。电脑上没有可靠的回声消除,所以 ta 说话时耳朵不收音。
- 网页版控制台没有麦克风。
- 随时可以在 控制 → 声音 关掉。
#和「录音」的区别
ta 还有一个「录音」能力:录一段声音存成文件。它属于 控制 → 权限 里的「麦克风」,默认每次先问你,和听觉是两回事。见 能力授权与安全。