素材生成:图片、音乐和视频
Chat 不只写代码。图片、音乐和视频都由平台的专门模型生成,你在对话里说一句就行,产物直接落到消息下方等你下载。这篇讲清每条链路能做什么、怎么改上一版、素材最后放哪。
三条链路,一句话说清
| 你想要 | 说一句就行 |
|---|---|
| 图片 | 海报、配图、插画、Logo、封面、商品图,以及改图、换背景、扩图、擦掉画面里的东西 |
| 看图 | 认一张图里有什么、把图里的文字提出来(OCR) |
| 音乐 | BGM、主题曲、片头音乐,纯音乐或带人声都行 |
| 视频 | 短片、片头、产品演示,也可以让一张静态图动起来 |
不用学任何参数写法,也不用先写一大段提示词——默认先做一版给你看,重试很便宜,不满意再说哪里不对。只有猜错等于白做的信息才会先问你,比如海报上要印的确切文案、要唱的歌词、扩图往哪个方向扩。
图片能做什么
| 你要做的事 | 例子 |
|---|---|
| 文生图 | 「给这篇笔记配一张图,暖色调,桌面上一杯咖啡」 |
| 局部编辑 | 「这张图的标题换成《今天喝什么》」 |
| 抠图换背景 | 「把这个产品抠出来,换成纯白背景」 |
| 扩图 | 「这张图太窄了,往两边补成 16:9」 |
| 擦除元素 | 「把画面右下角那个杯子去掉」 |
| 识图 / OCR | 「这张截图里报的什么错」「把这张发票上的字提出来」 |
看图这一条尤其省事:报错截图、合同照片、手写便签直接粘进输入框,比你自己敲一遍准得多。
音乐
一段完整的音乐,不是把音效拼起来。风格、情绪、用途、要不要人声、男声还是女声,这些普通人有直觉、又明显影响效果的,Agent 会用一两句话或一张卡片问你;BPM、编制、混音这类术语不会拿来烦你。
歌词有确切要求的话提前说,让它自己写也行。
视频
- 单次生成 2~30 秒、自带音轨的成片
- 文生视频:一句话描述画面
- 图生视频:给一张图,让它动起来——想保住已经认可的画面时用这条最稳
- 多镜头短片:超过五到八秒、或者有多个动作场景的片子,会先把整片的剧本和风格定下来,再逐个镜头生成,最后剪成成片、铺一条统一的 BGM
视频是唯一值得先聊两句再动手的一档:一次要跑几分钟。Agent 通常会先确认三件事——画面里有什么、这条片子用在哪、你手里有没有现成的图或视频。时长、版式、要不要声音都从「用在哪」反推,不会拿参数来问你。
改上一版:这里最容易翻车
「这张图光线亮一点」是最高频的后续需求,但它有两种完全不同的做法:
| 你在说什么 | 会发生什么 | |
|---|---|---|
| 局部改 | 就这一版,改其中某处(亮一点、去掉那个杯子、换个背景、标题换成 X) | 拿这张图本身当输入去编辑,构图和细节都保住 |
| 整体重做 | 方向不对、风格全换、重来一版 | 在上一版的基础上改掉你不满意的部分,重新生成 |
说「这张 / 这段 / 刚才那个」的时候要的几乎都是局部改。如果重跑了一次文生图,出来的会是另一张图——你已经认可的构图、人物、细节全没了。说得越具体越不容易走错:「就这张,把背景换成米白」比「再来一张」清楚得多。
改版一律出新文件名(poster_v2.png),原来那版不会被覆盖,随时能对比和回退。
素材最后放哪
- 只是给你看、给你下载:留在消息下方的产物列表里,点开就能存
- 要给应用长期用(网站配图、小程序素材、页面 BGM、首页演示视频):让 Agent 上传到这个应用的对象存储,再改代码引用。这样图片走加速地址直连,不占应用服务器带宽,也不会被打进镜像撑大体积
- 生成模型那边返回的原始地址都会过期,不要把它写进代码,也不要当长期链接发给别人
常见疑问
Q:要写很长的提示词吗? A:不用。用大白话说清楚要什么、用在哪就行,剩下的交给 Agent 转写。
Q:视频最长能多久? A:单次 2~30 秒。更长的片子是多个镜头逐个生成之后剪在一起的,所以并没有硬上限,只是越长越久。
Q:能保证多个镜头里的人是同一个人吗? A:多镜头会先定全片的设定再逐镜生成,一致性比逐条随手生成好得多,但仍不是百分之百。人物强一致的场景,用图生视频、拿同一张定妆图去驱动更稳。
Q:生成的图能直接放进我的网站吗? A:能。说一句「把这张图放到首页 banner」,Agent 会上传到应用的对象存储并改好代码。
Q:我上传的照片能拿来编辑吗? A:能。上传的文件和生成的产物一样,都可以当作编辑、扩图、擦除、图生视频的输入。
Q:做营销内容需要单独让它配图吗? A:不需要。营销出稿会连配图和封面一起给,见 07-marketing.md。
Q:配音、旁白和把录音转成文字也在这里吗? A:不在。那是另一条能力,见 14-voice.md。
下一步推荐:11-documents.md
