# 语音：配音、口播与语音转文字

把写好的文字读成人声，或者把一段录音变成能搜索、能编辑的文字。不用装剪辑软件，也不用自己开麦克风录——在 [Chat](#/chats) 里说一句就行。

平台的语音是两条方向相反的能力：**合成**（文字变声音）和**识别**（声音变文字）。下面分开说。

## 文字变声音

能拿来做这些事：

- 短视频旁白、产品演示的解说
- 口播稿的成品音频，稿子写完直接读出来
- 有声书，长稿分段合成，段与段之间语气是连着的
- 动态漫画的角色配音，不同角色给不同音色

直接说要什么就行：

```
把这段文案配成音，声音沉稳一点，语速慢一些
```

**音色不用记名字，说感觉就行**：「年轻一点的女声」「像纪录片旁白那种」「带点情绪，别太平」。听完不满意就说哪里不对——「太急了」「这句重音不对」——改的是同一段，不会给你换成另外一段。

## 声音变文字

- 会议录音、采访录音、播客，转成分好段落的文字稿
- 视频字幕：转写结果自带时间轴，可以直接当字幕用

把音频文件发进 Chat，或者给一个能打开的链接，然后说要什么：

```
这个录音帮我转成文字，分好段落
给这条视频生成中文字幕
```

录音里有好几个人说话时，提问时说一句「有三个人」，分段会准不少。

## 产出的东西在哪

合成的音频和生成的字幕都是**文件**，会出现在这次对话下方的产物列表里，点开就能下载。也可以不下载，直接接着说「把这段配音放进刚才那条视频」，它会接着用。

## 和动态漫画一起用

做动态漫画时配音不是单独一步，而是排在画完之后：**每句台词念多久，决定了对应那一格在片子里停多久**。所以顺序是先写台词、再画、最后配音合成；反过来先画完再补台词，就会出现画面三秒、话七秒，只能重排。

每个角色的声音会单独记成一张**声音卡**，和角色卡并排放在设定集里：上面写着这个人该怎么念（「清亮偏软的少女声，语速偏慢，句尾略上扬」），以及调高调低、快慢这些设定。第七话开配之前先看这张卡，所以第七话和第一话是同一个声音。你也可以点开设定集里的声音卡直接看它记了什么。

配好的音频会一条条挂到对应的那一格上，和画面一样算作品的素材，素材清单里能看到「第 3 话配音 18/20」。整条流程见 `15-dynamic-comic.md`。

## 几个要先知道的

**没有实时语音对话。** 平台只有「把文字合成一段音频」和「把一段音频转成文字」这两条，不能像打电话那样一来一回实时说话。用合成加识别拼起来也不行，那是批处理，延迟完全不是一回事。

**长稿不会被截断。** 超长的稿子会自动分段合成再拼起来，你拿到的是完整的一条。

**中英文都可以**，中英混排的稿子也能读。

下一步推荐：`15-dynamic-comic.md`
