典名词元典名词元首页
API 文档三方工具教程
AI 模型接口图像万相

图像生成与编辑同异步调用2.6

POST/api/v1/image/generation

Header Parameters

Authorization*string

使用 Bearer Token 认证。 格式: Authorization: Bearer sk-xxxxxx

X-DashScope-Sse?string

用于启用流式输出,仅当 parameters.enable_interleave=true 时,必须将该字段设为 enable

X-DashScope-Async?string

异步处理配置参数,必须设置为enable。

Request Body

application/json

model*string

模型名称。固定值:

wan2.6-image

Value in"wan2.6-image"
input*object

输入的基本信息。

messages*array<object>

请求内容数组。当前仅支持单轮对话,即传入一组role、content参数,不支持多轮对话。

[]?object
role*string

消息的角色。此参数固定设置为user。

content*array<object>

消息内容数组。

[]?object
text*string

正向提示词用于描述您期望生成的图像内容、风格和构图。

支持中英文,长度不超过2000个字符,每个汉字、字母、数字或符号计为一个字符,超过部分会自动截断。

示例值:参考这个风格的图片,生成番茄炒蛋。

注意:content数组中,必须且只能包含一个含 text 字段的对象。

image?string

输入图像的URL或Base64编码字符串。

图像限制:

图像格式:JPEG、JPG、PNG(不支持透明通道)、BMP、WEBP。

图像分辨率:图像的宽高范围均为[240, 8000]像素。

文件大小:不超过10MB。

图像数量限制:

输入图像数量与parameters.enable_interleave参数有关。

当enable_interleave=true时(图文混排输出),可输入0~1张图像。

当enable_interleave=false时(图像编辑),必须输入1~4张图像。

当输入多张图像时,需在content数组中传入多个image对象,并按照数组顺序定义图像顺序。

parameters?object

图像处理参数。

negative_prompt?string

反向提示词,用于描述不希望在图像中出现的内容,对画面进行限制。

支持中英文,长度不超过500个字符,超出部分将自动截断。

size?string

输出图片分辨率参数,支持参考输入图比例和直接指定两种方式。

当enable_interleave=false(即图像编辑模式)时:

方式一:参考输入图比例(推荐)

可选的输出分辨率档位:1K(默认)、2K。

1K:输出总像素接近 1280*1280,宽高比与最后一张输入图像一致。

2K:输出总像素接近 2048*2048,宽高比与最后一张输入图像一致。

方式二:指定生成图像的宽高像素值

总像素在 [768768, 20482048] 之间,且宽高比范围为 [1:4, 4:1]。

实际输出图像的像素值为接近指定值的16的倍数。

当enable_interleave=true(即图文混排输出模式)时:

方式一:参考输入图比例(默认方式)

若输入图像总像素 ≤ 1280*1280,输出总像素和宽高比与输入图像一致。

若输入图像总像素 > 12801280,输出总像素接近 12801280,宽高比与输入图像一致。

方式二:指定生成图像的宽高像素值

总像素在 [768768, 12801280] 之间,且宽高比范围为 [1:4, 4:1]。

实际输出图像的像素值为接近指定值的16的倍数。

常见比例推荐的分辨率:

1:1:1280*1280

2:3:800*1200

3:2:1200*800

3:4:960*1280

4:3:1280*960

9:16:720*1280

16:9:1280*720

21:9:1344*576

enable_interleave?boolean

控制生图模式:

false:默认值,表示图像编辑模式(支持多图输入及主体一致性生成)。

用途:基于1~4张输入图像进行编辑、风格迁移或主体一致性生成。

输入:必须提供至少1张参考图像。

输出:可生成1至4张结果图像。

true :表示启用图文混排输出模式(仅支持传入一张图像或不传图像)。

用途:根据文本描述生成图文并茂的内容,或进行纯文本生成图像(文生图)。

输入:可以不提供图像(文生图),或提供最多1张参考图像。

输出:生成包含文本和图像的混合内容。

n?integer

指定生成图片的数量。该参数的取值范围与含义取决于 enable_interleave(模式开关)的状态:

当 enable_interleave=false(图像编辑模式):

作用:直接控制生成图像的数量。

取值范围:1~4,默认值为 4。

建议在测试阶段将此值设置为 1,以便低成本验证效果。

当 enable_interleave=true(图文混排模式):

限制:此参数默认为1,且必须固定为1。若设置为其他值,接口将报错。

说明:在此模式下,如需控制生成图像的数量上限,请使用 max_images 参数。

max_images?integer

仅在图文混排模式(即 enable_interleave=true)下生效。

作用:指定模型在单次回复中生成图像的最大数量。

取值范围:1~5,默认值为 5。

注意:该参数仅代表“数量上限”。实际生成的图像数量由模型推理决定,可能会少于设定值(例如:设置为 5,模型可能根据内容仅生成 3 张)

prompt_extend?boolean

仅在图像编辑模式(即enable_interleave = false)下生效。

是否开启 Prompt(提示词)智能改写功能。该功能仅对正向提示词进行优化与润色,不会改变反向提示词。

true:默认值,开启智能改写。

false:关闭智能改写,使用原始提示词。

stream?boolean

控制返回结果是否为流式输出。在图像混排模式(即 enable_interleave = true)下,必须设置为true。

false:默认值,非流式输出。

true:流式输出。

watermark?boolean

是否添加水印标识,水印位于图片右下角,文案固定为“AI生成”。

false:默认值,不添加水印。

true:添加水印。

seed?integer

随机数种子,取值范围[0,2147483647]。

使用相同的seed参数值可使生成内容保持相对稳定。若不提供,算法将自动使用随机数种子。

注意:模型生成过程具有概率性,即使使用相同的seed,也不能保证每次生成结果完全一致。

Response Body

application/json

curl -X POST "https://api.aa.com.cn/api/v1/image/generation" \  -H "Authorization: string" \  -H "X-DashScope-Sse: string" \  -H "X-DashScope-Async: string" \  -H "Content-Type: application/json" \  -d '{    "model": "wan2.6-image",    "input": {      "messages": [        {          "role": "string",          "content": [            {              "text": "string",              "image": "string"            }          ]        }      ]    },    "parameters": {      "negative_prompt": "string",      "size": "string",      "enable_interleave": true,      "n": 0,      "max_images": 0,      "prompt_extend": true,      "stream": true,      "watermark": true,      "seed": 0    }  }'
{
  "code": 0,
  "data": {
    "urls": [
      "string"
    ],
    "usage": {
      "images": 0,
      "seconds": 0,
      "input_tokens": 0,
      "total_tokens": 0,
      "output_tokens": 0
    },
    "expired": "string",
    "task_id": "string",
    "task_status": "string"
  },
  "message": "string",
  "request_id": "string"
}