语音:配音、口播与语音转文字
把写好的文字读成人声,或者把一段录音变成能搜索、能编辑的文字。不用装剪辑软件,也不用自己开麦克风录——在 Chat 里说一句就行。
平台的语音是两条方向相反的能力:合成(文字变声音)和识别(声音变文字)。下面分开说。
文字变声音
能拿来做这些事:
- 短视频旁白、产品演示的解说
- 口播稿的成品音频,稿子写完直接读出来
- 有声书,长稿分段合成,段与段之间语气是连着的
- 动态漫画的角色配音,不同角色给不同音色
直接说要什么就行:
把这段文案配成音,声音沉稳一点,语速慢一些
音色不用记名字,说感觉就行:「年轻一点的女声」「像纪录片旁白那种」「带点情绪,别太平」。听完不满意就说哪里不对——「太急了」「这句重音不对」——改的是同一段,不会给你换成另外一段。
声音变文字
- 会议录音、采访录音、播客,转成分好段落的文字稿
- 视频字幕:转写结果自带时间轴,可以直接当字幕用
把音频文件发进 Chat,或者给一个能打开的链接,然后说要什么:
这个录音帮我转成文字,分好段落
给这条视频生成中文字幕
录音里有好几个人说话时,提问时说一句「有三个人」,分段会准不少。
产出的东西在哪
合成的音频和生成的字幕都是文件,会出现在这次对话下方的产物列表里,点开就能下载。也可以不下载,直接接着说「把这段配音放进刚才那条视频」,它会接着用。
和动态漫画一起用
做动态漫画时配音不是单独一步,而是排在画完之后:每句台词念多久,决定了对应那一格在片子里停多久。所以顺序是先写台词、再画、最后配音合成;反过来先画完再补台词,就会出现画面三秒、话七秒,只能重排。
每个角色的声音会单独记成一张声音卡,和角色卡并排放在设定集里:上面写着这个人该怎么念(「清亮偏软的少女声,语速偏慢,句尾略上扬」),以及调高调低、快慢这些设定。第七话开配之前先看这张卡,所以第七话和第一话是同一个声音。你也可以点开设定集里的声音卡直接看它记了什么。
配好的音频会一条条挂到对应的那一格上,和画面一样算作品的素材,素材清单里能看到「第 3 话配音 18/20」。整条流程见 15-dynamic-comic.md。
几个要先知道的
没有实时语音对话。 平台只有「把文字合成一段音频」和「把一段音频转成文字」这两条,不能像打电话那样一来一回实时说话。用合成加识别拼起来也不行,那是批处理,延迟完全不是一回事。
长稿不会被截断。 超长的稿子会自动分段合成再拼起来,你拿到的是完整的一条。
中英文都可以,中英混排的稿子也能读。
下一步推荐:15-dynamic-comic.md
