提示词指南:Qwen-Image-2.1

Qwen-Image-2.1 是阿里巴巴最强力的开源图像生成模型,一个模型同时承担文生图与图像编辑两件事。其 70 亿参数的视觉生成组件(32 层单流 DiT)配以 Qwen3-VL 8B 文本编码器与 64 通道 RGBA 自编码器,支持原生透明通道输出。在 MindCraft Studio 中它以本地 MLX 模型运行,亮点是中英双语提示词理解、图像内文字渲染精准,以及最多 10 张参考图的编辑能力。

本指南介绍该模型在 MindCraft Studio 中的实际行为,以及获得最佳效果所需的提示词技巧。


1. 推荐设置

模型的原始分辨率是 2K,但在 Mac 上以更小尺寸运行。MindCraft Studio 的默认值已针对本地硬件调校:

  • 尺寸 — 从 512×512 开始;提升到 1024×1024 效果明显更好。两边都必须是 16 的倍数
  • 步数 — 应用默认 20 步。需要精细细节或清晰文字时用 40 步(模型官方推荐,耗时约翻倍)。低步数只用于检查构图——绝不要用低步数结果评判画质。
  • 宽高比 — 选择模型的原生比例再以更小尺寸渲染(见 宽高比与分辨率)。宽幅或全景无需参考图,直接设一个宽幅尺寸即可。
  • 无否定提示词 — 该模型的否定提示词输入框被隐藏。不要写 "avoid X" 或罗列你不想要的内容;只描述画面中应该出现什么。
  • 无强度滑块 — 参考图是上下文,不是一个被部分重噪的起始图,因此"保留原图三成"做不到。指令文本是唯一的杠杆。

2. 手写文生图提示词

  • 写自然流畅的句子,而不是关键词堆砌。 模型把提示词当作句子来读,因此语法与明确的空间关系("in front of"、"behind"、"next to")会实打实地改变结果。
  • 丰富短输入—补充材质与纹理、光线、取景与景深。
  • 点名具体细节 —如 "85 mm portrait lens"(85mm 人像镜头)、"soft window light"(柔和的窗光)、"subsurface scattering on skin"(皮肤次表面散射)、"wet specular highlights on leaves"(叶片上的湿润高光)。模型回应具体场景内容,而非 "photorealistic、8k、masterpiece" 这类质量标签。
  • 保留逻辑关系 —流程图或示意图要保持用户描述中的连接与箭头。
  • 正向表述 —既然没有否定提示词框,就只写画面里有什么,不写没有什么。

实例:短输入 → 扩展后 短输入: 一只在野餐时弹尤克里里的柯基 扩展后: A realistic photograph of a corgi sitting upright on a red-and-white checked picnic blanket in a sunny park, playing a wooden ukulele. The corgi looks up with a playful expression, its orange and white fur soft in bright midday sunlight. On the blanket around it sit a wicker basket, a thermos, and a few scattered daisies. Shot on an 85 mm lens with a shallow depth of field; the trees behind blur into green bokeh. Warm, natural color balance, gentle contrast.


3. 渲染清晰文字与排版

文字排版正是本次更新的最大亮点——请放心大胆地进行文字密集型创作(海报、招牌、包装、信息图表):

  • 把确切文案放进双引号 —例如 a shop sign reading "MindCraft"
  • 绝不翻译、改写或纠正引号内的文字 —包括大小写与标点,原样复现。
  • 用文字描述文字的风格 —例如 "MindCraft" in bold orange sans-serif at the top centre of the poster
  • 中文文字保持中文 —在意字形时还可以指定字体家族(如楷体、宋体、黑体)。
  • 引号内必须原样渲染,引号外自由描述 —只有需要逐字呈现的文案才放进引号。

示例提示词: A minimal poster for a jazz festival, a bold white title reading "JAZZ NIGHTS" across the top centre, deep navy background, abstract warm-gold instrument silhouettes along the lower half, soft spotlight from above.


4. 透明背景(RGBA)—直接使用 α 开关

Qwen-Image-2.1 的 VAE 输出真实的 Alpha 通道,因此可以原生生成透明 PNG。在 MindCraft Studio 中,它是唯一带有透明背景开关——提示词框旁的 α 按钮(tooltip"透明背景") 的模型。

  • 想要透明背景、抠图、贴纸、无背景 PNG 或用于合成的素材时:打开 α 开关。 同一个开关还覆盖透明图层内的编辑(改变主体表情但保持背景透明)与从普通照片中抠出主体——给一张普通照片,要求主体独立呈现于透明背景即可。只需用文字描述主体并生成,其余交给应用。
  • 低步数下边缘偏软 —需要干净抠图时提高步数。
  • 白色边缘通常意味着"贴纸"。 "sticker"一词会让模型画出类似印刷贴纸的裁切白边。不想要白边就去掉 "sticker",直接要求主体单独呈现于透明背景。

5. 图像编辑提示词

参考图与文字由同一个编码器读取,因此指令要写成一句**"关于这张图"的陈述**,而不是对工具的指令:

  • 描述结果,而非操作。 "A red fox sitting on a sandy beach at sunset"(夕阳沙滩上的一只红狐)可行;"change the background"(换背景)是在要求一套流程。点明主体、新情境与光线。
  • 重申必须保留的部分。 身份与姿势通常能自动保持,但点名能帮忙:"…, keeping the fox's face, pose, and fur exactly as they are."
  • 一条指令只做一处改动。 同时进行多项无锚点的整体改动(改毛色 + 换背景 + 加文字)最容易翻车——改为依次编辑。以区域为锚点的改动是例外(见 局部编辑)。
  • 不要否定表述 —与文生图相同的原则:只写应该有什么。
  • 先定构图。 内容好改、取景难改——方形照片变宽幅全景是难点,所以要在编辑前先设置好宽幅输出。

**性能:**同一尺寸下,编辑远比文生图更耗资源。编辑建议从 256×256、20 步开始。24 GB 机器上 512×512 的编辑可能长时间卡住而非完成——进度条不再移动时,应降低尺寸而不是干等。也不要同时调高尺寸与步数。


6. 多参考图与局部编辑

  • 多参考图(最多 10 张)。 模型会组合参考图:"put the person from the first image on the sofa from the second."(把第一张图的人放到第二张图的沙发上)。顺序很重要 —按附件顺序称呼它们("第一张图""第二张图")。每多一张参考图都会变慢,请只使用承载信息所需的最少张数。
  • 局部编辑——三种方式指向区域。 模型原生理解直接画在图上的区域——官方就是用圆圈与涂鸦标注来演示的,可以指着 "蓝圈里""红圈区域" 发号施令。MindCraft Studio 把同样的能力做成 Modify 菜单里的 Annotate(标注)工具:直接在照片上画椭圆、矩形、自由笔迹、箭头或文字,涂上不同颜色,然后选择**生成(直通)**模式把标注图原样发给模型——无需用文字描述区域,当然也可以像官方演示那样在提示词中引用标注颜色("我涂成绿色的区域")进一步引导。
  • 局部编辑——Inpaint(局部重绘)与橡皮擦。 也可以完全不描述区域,只把它涂出来:Inpaint 工具会发送带标记的图像与一条点名颜色的指令,Only replace the red area(s) with <你的内容> to complete the image, keep other pixels unchanged.(只替换红色区域,其余像素保持不变)。橡皮擦(Eraser) 工具则把区域涂实并要求模型填充。
  • 文字命名区域同样有效。 官方自带的示例:"Remove the metal watch in the blue circle, change the hair in the red circle to black, and replace the area in the green circle with gray short-sleeved linen pajamas."(移除蓝圈里的金属表、把红圈里的头发改成黑色、把绿圈区域替换成灰色亚麻短袖睡衣。)一条指令中多处"以区域为锚"的改动没问题——点明每个区域就不会互相污染。
  • 只标记需要改变的部分。 标记区域过大留给模型的上下文就少——若改动覆盖大半画面,重新完整描述整张图反而更好。

代表作展示——全景图、信息图与分镜图(官方博客以一张参考图演示这三类编辑;它们都是普通编辑,可直接在应用内复刻,这里附上示例提示词):

  • 全景图设好宽幅输出(在尺寸菜单选一个宽比例,例如小尺寸的 16:9),再附加照片并输入:

    把这张照片扩展成同一山间河谷的宽幅全景,两侧继续延伸山脊、天空与晨光。保持徒步者、他的姿态与前景岩石完全不变。匹配原图的透视与光线方向,让接缝平滑融合。

  • 信息图 —附加一张产品照片,要求生成信息丰富、信息密集的构图:

    把这张产品照片做成一张详细的信息图表海报,产品作为主体。加入分解结构图、加粗大标题 "AERO BOTTLE"、带细白指引线标注的技术规格、刻度线,以及在浅灰色背景上的干净技术排版。

  • 分镜图 —附加一张角色设定图,要求生成多格画面:

    把这张三视图角色设定图做成六格分镜。所有格子的角色设计、面部与服装配色保持一致;每格让她处于不同场景与光线下的情节中,取景统一。用网格排列各格,间距均匀。

同样值得一试:抠图 —附加一张照片,要求主体单独呈现于透明背景(打开 α 开关)。


7. 宽高比与分辨率

Qwen-Image-2.1 的原生宽高比均为 2K 分辨率。在 Mac 上请选择比例并以更小尺寸渲染(边长取 16 的倍数):

宽高比原生分辨率
1:12048 × 2048
4:32400 × 1792
3:41792 × 2400
3:22528 × 1696
2:31696 × 2528
16:92752 × 1536
9:161536 × 2752

8. 画面约束与负面引导

该模型没有否定提示词输入框,因此只能通过"你描述了什么"来控制输出:

  • 绝不以禁止的口吻提要求 —"没有筷子的桌子"应描述为仅有桌子,而不是罗列要排除的东西。
  • 保证编辑忠实 —用正向方式重申一次必须保留的内容:"保持画面其余部分与输入图完全一致"。
  • 保证文字整洁 —用引号标出应出现的文案并描述其风格,就没有让乱码立足的空间。

准备好开始生成了吗?了解 提示词编辑器 中的参数配置,或在 无限画布 上搭建多参考图场景。

提示词指南:Qwen-Image-2.1 | MindCraft Studio Tutorial