Quodara回到 Quodara 首页

语音:配音、口播与语音转文字

把写好的文字读成人声,或者把一段录音变成能搜索、能编辑的文字。不用装剪辑软件,也不用自己开麦克风录——在 Chat 里说一句就行。

平台的语音是两条方向相反的能力:合成(文字变声音)和识别(声音变文字)。下面分开说。

文字变声音

能拿来做这些事:

直接说要什么就行:

把这段文案配成音,声音沉稳一点,语速慢一些

音色不用记名字,说感觉就行:「年轻一点的女声」「像纪录片旁白那种」「带点情绪,别太平」。听完不满意就说哪里不对——「太急了」「这句重音不对」——改的是同一段,不会给你换成另外一段。

声音变文字

把音频文件发进 Chat,或者给一个能打开的链接,然后说要什么:

这个录音帮我转成文字,分好段落
给这条视频生成中文字幕

录音里有好几个人说话时,提问时说一句「有三个人」,分段会准不少。

产出的东西在哪

合成的音频和生成的字幕都是文件,会出现在这次对话下方的产物列表里,点开就能下载。也可以不下载,直接接着说「把这段配音放进刚才那条视频」,它会接着用。

和动态漫画一起用

做动态漫画时配音不是单独一步,而是排在画完之后:每句台词念多久,决定了对应那一格在片子里停多久。所以顺序是先写台词、再画、最后配音合成;反过来先画完再补台词,就会出现画面三秒、话七秒,只能重排。

每个角色的声音会单独记成一张声音卡,和角色卡并排放在设定集里:上面写着这个人该怎么念(「清亮偏软的少女声,语速偏慢,句尾略上扬」),以及调高调低、快慢这些设定。第七话开配之前先看这张卡,所以第七话和第一话是同一个声音。你也可以点开设定集里的声音卡直接看它记了什么。

配好的音频会一条条挂到对应的那一格上,和画面一样算作品的素材,素材清单里能看到「第 3 话配音 18/20」。整条流程见 15-dynamic-comic.md

几个要先知道的

没有实时语音对话。 平台只有「把文字合成一段音频」和「把一段音频转成文字」这两条,不能像打电话那样一来一回实时说话。用合成加识别拼起来也不行,那是批处理,延迟完全不是一回事。

长稿不会被截断。 超长的稿子会自动分段合成再拼起来,你拿到的是完整的一条。

中英文都可以,中英混排的稿子也能读。

下一步推荐:15-dynamic-comic.md

本文的 Markdown 版本 · 站点说明文件 llms.txt(给 AI 读)