提示词指南:Qwen-Image-2.1
Qwen-Image-2.1 是阿里巴巴最强力的开源图像生成模型,一个模型同时承担文生图与图像编辑两件事。其 70 亿参数的视觉生成组件(32 层单流 DiT)配以 Qwen3-VL 8B 文本编码器与 64 通道 RGBA 自编码器,支持原生透明通道输出。在 MindCraft Studio 中它以本地 MLX 模型运行,亮点是中英双语提示词理解、图像内文字渲染精准,以及最多 10 张参考图的编辑能力。
本指南介绍该模型在 MindCraft Studio 中的实际行为,以及获得最佳效果所需的提示词技巧。
1. 推荐设置
模型的原始分辨率是 2K,但在 Mac 上以更小尺寸运行。MindCraft Studio 的默认值已针对本地硬件调校:
- 尺寸 — 从 512×512 开始;提升到 1024×1024 效果明显更好。两边都必须是 16 的倍数。
- 步数 — 应用默认 20 步。需要精细细节或清晰文字时用 40 步(模型官方推荐,耗时约翻倍)。低步数只用于检查构图——绝不要用低步数结果评判画质。
- 宽高比 — 选择模型的原生比例再以更小尺寸渲染(见 宽高比与分辨率)。宽幅或全景无需参考图,直接设一个宽幅尺寸即可。
- 无否定提示词 — 该模型的否定提示词输入框被隐藏。不要写 "avoid X" 或罗列你不想要的内容;只描述画面中应该出现什么。
- 无强度滑块 — 参考图是上下文,不是一个被部分重噪的起始图,因此"保留原图三成"做不到。指令文本是唯一的杠杆。
2. 手写文生图提示词
- 写自然流畅的句子,而不是关键词堆砌。 模型把提示词当作句子来读,因此语法与明确的空间关系("in front of"、"behind"、"next to")会实打实地改变结果。
- 丰富短输入—补充材质与纹理、光线、取景与景深。
- 点名具体细节 —如 "85 mm portrait lens"(85mm 人像镜头)、"soft window light"(柔和的窗光)、"subsurface scattering on skin"(皮肤次表面散射)、"wet specular highlights on leaves"(叶片上的湿润高光)。模型回应具体场景内容,而非 "photorealistic、8k、masterpiece" 这类质量标签。
- 保留逻辑关系 —流程图或示意图要保持用户描述中的连接与箭头。
- 正向表述 —既然没有否定提示词框,就只写画面里有什么,不写没有什么。
实例:短输入 → 扩展后 短输入:
一只在野餐时弹尤克里里的柯基扩展后:A realistic photograph of a corgi sitting upright on a red-and-white checked picnic blanket in a sunny park, playing a wooden ukulele. The corgi looks up with a playful expression, its orange and white fur soft in bright midday sunlight. On the blanket around it sit a wicker basket, a thermos, and a few scattered daisies. Shot on an 85 mm lens with a shallow depth of field; the trees behind blur into green bokeh. Warm, natural color balance, gentle contrast.
3. 渲染清晰文字与排版
文字排版正是本次更新的最大亮点——请放心大胆地进行文字密集型创作(海报、招牌、包装、信息图表):
- 把确切文案放进双引号 —例如
a shop sign reading "MindCraft"。 - 绝不翻译、改写或纠正引号内的文字 —包括大小写与标点,原样复现。
- 用文字描述文字的风格 —例如
"MindCraft" in bold orange sans-serif at the top centre of the poster。 - 中文文字保持中文 —在意字形时还可以指定字体家族(如楷体、宋体、黑体)。
- 引号内必须原样渲染,引号外自由描述 —只有需要逐字呈现的文案才放进引号。
示例提示词:
A minimal poster for a jazz festival, a bold white title reading "JAZZ NIGHTS" across the top centre, deep navy background, abstract warm-gold instrument silhouettes along the lower half, soft spotlight from above.
4. 透明背景(RGBA)—直接使用 α 开关
Qwen-Image-2.1 的 VAE 输出真实的 Alpha 通道,因此可以原生生成透明 PNG。在 MindCraft Studio 中,它是唯一带有透明背景开关——提示词框旁的 α 按钮(tooltip"透明背景") 的模型。
- 想要透明背景、抠图、贴纸、无背景 PNG 或用于合成的素材时:打开 α 开关。 同一个开关还覆盖透明图层内的编辑(改变主体表情但保持背景透明)与从普通照片中抠出主体——给一张普通照片,要求主体独立呈现于透明背景即可。只需用文字描述主体并生成,其余交给应用。
- 低步数下边缘偏软 —需要干净抠图时提高步数。
- 白色边缘通常意味着"贴纸"。 "sticker"一词会让模型画出类似印刷贴纸的裁切白边。不想要白边就去掉 "sticker",直接要求主体单独呈现于透明背景。
5. 图像编辑提示词
参考图与文字由同一个编码器读取,因此指令要写成一句**"关于这张图"的陈述**,而不是对工具的指令:
- 描述结果,而非操作。 "A red fox sitting on a sandy beach at sunset"(夕阳沙滩上的一只红狐)可行;"change the background"(换背景)是在要求一套流程。点明主体、新情境与光线。
- 重申必须保留的部分。 身份与姿势通常能自动保持,但点名能帮忙:"…, keeping the fox's face, pose, and fur exactly as they are."
- 一条指令只做一处改动。 同时进行多项无锚点的整体改动(改毛色 + 换背景 + 加文字)最容易翻车——改为依次编辑。以区域为锚点的改动是例外(见 局部编辑)。
- 不要否定表述 —与文生图相同的原则:只写应该有什么。
- 先定构图。 内容好改、取景难改——方形照片变宽幅全景是难点,所以要在编辑前先设置好宽幅输出。
**性能:**同一尺寸下,编辑远比文生图更耗资源。编辑建议从 256×256、20 步开始。24 GB 机器上 512×512 的编辑可能长时间卡住而非完成——进度条不再移动时,应降低尺寸而不是干等。也不要同时调高尺寸与步数。
6. 多参考图与局部编辑
- 多参考图(最多 10 张)。 模型会组合参考图:"put the person from the first image on the sofa from the second."(把第一张图的人放到第二张图的沙发上)。顺序很重要 —按附件顺序称呼它们("第一张图""第二张图")。每多一张参考图都会变慢,请只使用承载信息所需的最少张数。
- 局部编辑——三种方式指向区域。 模型原生理解直接画在图上的区域——官方就是用圆圈与涂鸦标注来演示的,可以指着 "蓝圈里"、"红圈区域" 发号施令。MindCraft Studio 把同样的能力做成 Modify 菜单里的 Annotate(标注)工具:直接在照片上画椭圆、矩形、自由笔迹、箭头或文字,涂上不同颜色,然后选择**生成(直通)**模式把标注图原样发给模型——无需用文字描述区域,当然也可以像官方演示那样在提示词中引用标注颜色("我涂成绿色的区域")进一步引导。
- 局部编辑——Inpaint(局部重绘)与橡皮擦。 也可以完全不描述区域,只把它涂出来:Inpaint 工具会发送带标记的图像与一条点名颜色的指令,
Only replace the red area(s) with <你的内容> to complete the image, keep other pixels unchanged.(只替换红色区域,其余像素保持不变)。橡皮擦(Eraser) 工具则把区域涂实并要求模型填充。 - 文字命名区域同样有效。 官方自带的示例:"Remove the metal watch in the blue circle, change the hair in the red circle to black, and replace the area in the green circle with gray short-sleeved linen pajamas."(移除蓝圈里的金属表、把红圈里的头发改成黑色、把绿圈区域替换成灰色亚麻短袖睡衣。)一条指令中多处"以区域为锚"的改动没问题——点明每个区域就不会互相污染。
- 只标记需要改变的部分。 标记区域过大留给模型的上下文就少——若改动覆盖大半画面,重新完整描述整张图反而更好。
代表作展示——全景图、信息图与分镜图(官方博客以一张参考图演示这三类编辑;它们都是普通编辑,可直接在应用内复刻,这里附上示例提示词):
- 全景图 —先设好宽幅输出(在尺寸菜单选一个宽比例,例如小尺寸的 16:9),再附加照片并输入:
把这张照片扩展成同一山间河谷的宽幅全景,两侧继续延伸山脊、天空与晨光。保持徒步者、他的姿态与前景岩石完全不变。匹配原图的透视与光线方向,让接缝平滑融合。 - 信息图 —附加一张产品照片,要求生成信息丰富、信息密集的构图:
把这张产品照片做成一张详细的信息图表海报,产品作为主体。加入分解结构图、加粗大标题 "AERO BOTTLE"、带细白指引线标注的技术规格、刻度线,以及在浅灰色背景上的干净技术排版。 - 分镜图 —附加一张角色设定图,要求生成多格画面:
把这张三视图角色设定图做成六格分镜。所有格子的角色设计、面部与服装配色保持一致;每格让她处于不同场景与光线下的情节中,取景统一。用网格排列各格,间距均匀。
同样值得一试:抠图 —附加一张照片,要求主体单独呈现于透明背景(打开 α 开关)。
7. 宽高比与分辨率
Qwen-Image-2.1 的原生宽高比均为 2K 分辨率。在 Mac 上请选择比例并以更小尺寸渲染(边长取 16 的倍数):
| 宽高比 | 原生分辨率 |
|---|---|
1:1 | 2048 × 2048 |
4:3 | 2400 × 1792 |
3:4 | 1792 × 2400 |
3:2 | 2528 × 1696 |
2:3 | 1696 × 2528 |
16:9 | 2752 × 1536 |
9:16 | 1536 × 2752 |
8. 画面约束与负面引导
该模型没有否定提示词输入框,因此只能通过"你描述了什么"来控制输出:
- 绝不以禁止的口吻提要求 —"没有筷子的桌子"应描述为仅有桌子,而不是罗列要排除的东西。
- 保证编辑忠实 —用正向方式重申一次必须保留的内容:"保持画面其余部分与输入图完全一致"。
- 保证文字整洁 —用引号标出应出现的文案并描述其风格,就没有让乱码立足的空间。