语音控制提词器是怎么工作的:VoiceScroll 原理解析
普通提词器会按照你设定的速度一直往上滚。你一停顿,脚本就先跑了;你想留一点空白,反而要等屏幕追上来。VoiceScroll换了一个思路,它不是让你跟着文字跑,而是让文字跟着你说话的节奏走。
为什么固定速度总是别扭
真实讲话不会匀速。熟悉的部分会快一点,重点会慢一点,中间还会停顿、重说、换个表达。固定速度忽略了这些变化,结果就是你在配合机器,而不是自然开口。
VoiceScroll怎么跟上你的声音
- 导入脚本后,应用会先整理文本,方便后面定位。
- 点开始后,麦克风开启,语音识别开始处理你的声音:iPhone 和 iPad 上用 Apple 的语音识别,Android 上用设备上安装的识别服务(通常是 Google)。
- 识别出的内容会和脚本做匹配,定位到你当前说到的位置。
- 已经说过的部分会淡出,当前位置保持可见,页面自动跟着移动。
全部在设备本地完成
默认情况下,识别在设备本地完成(iPhone、iPad 使用 Apple 的 Speech 框架,Android 使用设备自带的识别服务,且需要已安装该语言的离线语言包)。在这个默认状态下,音频不会上传到服务器,语言准备好之后也不需要联网。没有网络往返延迟,也不怕现场网络差。在线识别是需要你自己打开的选项,默认关闭(iPhone、iPad 从 2.0.4 起使用 Apple 服务器,Android 从 1.11.16 起使用 Google),打开后音频会发送到该服务。它在 iPhone、iPad 上支持 34 种语言、在 Android 上支持 26 种语言,包括中文和日语,所以多语言脚本也能按同样的方式使用。
最适合的场景
- 录视频时需要停顿、重来或临时改句子
- 演讲中会被掌声、提问打断
- 中文、日文这类不适合固定滚速的脚本
- 长稿录制,希望始终按自己的节奏说