Quodara回到 Quodara 首页

素材生成:图片、音乐和视频

Chat 不只写代码。图片、音乐和视频都由平台的专门模型生成,你在对话里说一句就行,产物直接落到消息下方等你下载。这篇讲清每条链路能做什么、怎么改上一版、素材最后放哪。

三条链路,一句话说清

你想要说一句就行
图片海报、配图、插画、Logo、封面、商品图,以及改图、换背景、扩图、擦掉画面里的东西
看图认一张图里有什么、把图里的文字提出来(OCR)
音乐BGM、主题曲、片头音乐,纯音乐或带人声都行
视频短片、片头、产品演示,也可以让一张静态图动起来

不用学任何参数写法,也不用先写一大段提示词——默认先做一版给你看,重试很便宜,不满意再说哪里不对。只有猜错等于白做的信息才会先问你,比如海报上要印的确切文案、要唱的歌词、扩图往哪个方向扩。

图片能做什么

你要做的事例子
文生图「给这篇笔记配一张图,暖色调,桌面上一杯咖啡」
局部编辑「这张图的标题换成《今天喝什么》」
抠图换背景「把这个产品抠出来,换成纯白背景」
扩图「这张图太窄了,往两边补成 16:9」
擦除元素「把画面右下角那个杯子去掉」
识图 / OCR「这张截图里报的什么错」「把这张发票上的字提出来」

看图这一条尤其省事:报错截图、合同照片、手写便签直接粘进输入框,比你自己敲一遍准得多。

音乐

一段完整的音乐,不是把音效拼起来。风格、情绪、用途、要不要人声、男声还是女声,这些普通人有直觉、又明显影响效果的,Agent 会用一两句话或一张卡片问你;BPM、编制、混音这类术语不会拿来烦你。

歌词有确切要求的话提前说,让它自己写也行。

视频

视频是唯一值得先聊两句再动手的一档:一次要跑几分钟。Agent 通常会先确认三件事——画面里有什么、这条片子用在哪、你手里有没有现成的图或视频。时长、版式、要不要声音都从「用在哪」反推,不会拿参数来问你。

改上一版:这里最容易翻车

「这张图光线亮一点」是最高频的后续需求,但它有两种完全不同的做法:

你在说什么会发生什么
局部改就这一版,改其中某处(亮一点、去掉那个杯子、换个背景、标题换成 X)这张图本身当输入去编辑,构图和细节都保住
整体重做方向不对、风格全换、重来一版在上一版的基础上改掉你不满意的部分,重新生成

说「这张 / 这段 / 刚才那个」的时候要的几乎都是局部改。如果重跑了一次文生图,出来的会是另一张图——你已经认可的构图、人物、细节全没了。说得越具体越不容易走错:「就这张,把背景换成米白」比「再来一张」清楚得多。

改版一律出新文件名(poster_v2.png),原来那版不会被覆盖,随时能对比和回退。

素材最后放哪

常见疑问

Q:要写很长的提示词吗? A:不用。用大白话说清楚要什么、用在哪就行,剩下的交给 Agent 转写。

Q:视频最长能多久? A:单次 2~30 秒。更长的片子是多个镜头逐个生成之后剪在一起的,所以并没有硬上限,只是越长越久。

Q:能保证多个镜头里的人是同一个人吗? A:多镜头会先定全片的设定再逐镜生成,一致性比逐条随手生成好得多,但仍不是百分之百。人物强一致的场景,用图生视频、拿同一张定妆图去驱动更稳。

Q:生成的图能直接放进我的网站吗? A:能。说一句「把这张图放到首页 banner」,Agent 会上传到应用的对象存储并改好代码。

Q:我上传的照片能拿来编辑吗? A:能。上传的文件和生成的产物一样,都可以当作编辑、扩图、擦除、图生视频的输入。

Q:做营销内容需要单独让它配图吗? A:不需要。营销出稿会连配图和封面一起给,见 07-marketing.md

Q:配音、旁白和把录音转成文字也在这里吗? A:不在。那是另一条能力,见 14-voice.md

下一步推荐:11-documents.md

本文的 Markdown 版本 · 站点说明文件 llms.txt(给 AI 读)