· 作者 · 更新于

用 GPT-Image-2 批量生成 AI 人物图:可复用的提示词框架与题材示例

用一套可替换角色、服装、动作与场景的中文提示词模板,批量生成具有不同景别、角度和姿势的 AI 人物图,并了解公开发布与后续账号运营的注意点。

原始来源:X @wanerfu

用 GPT-Image-2 批量生成 AI 人物图:可复用的提示词框架与题材示例配图 1

原文围绕 GPT-Image-2 的一轮测试提出:批量生成 AI 人物图时,不必依赖摄影术语、镜头参数或大量关键词;更重要的是用清晰的自然语言交代人物、服装、构图、场景和光线。这样可以一次得到多组有明显差异的画面,并可将同一框架替换为啦啦队、女仆、护士等题材。

先看测试结论

用 GPT-Image-2 批量生成 AI 人物图:可复用的提示词框架与题材示例配图 2

原文以成年女性赛车宝贝为例:未使用摄影流派、光圈或焦段等术语,而是明确指定服装、地点、拍摄角度与动作,最终要求生成 8 种不同版本。

这 8 组画面不只是更换背景或颜色,而包含不同景别、视角和姿势。原文据此判断,GPT-Image-2 更依赖明确、具体的描述,而非堆叠看似专业的关键词。

完整提示词

原文使用的提示词如下:

生成一组成年女性赛车宝贝的图片。画面比例为 3:4,穿超短款赛车服,服装设计突出上半身线条和腿部比例。肤色白皙,腿部修长。包含上半身特写、下半身特写等不同景别。加入抬起手臂、单手叉腰、俯身、从脚下向上仰拍等不同构图。同时包含正面、背面等不同角度。加入近景和远景画面。包含手持遮阳伞、比剪刀手、眨眼等不同姿势。拍摄地点为赛车场维修区。使用明亮的户外自然阳光。改变画面风格,生成 8 种不同版本。

这段提示词由日常可理解的描述组成,例如超短赛车服、白皙腿部、维修区、户外阳光、正面、背面、远景与近景。原文认为,效果关键不在某个单独的“神奇关键词”,而在信息的组织方式。

将构图要求拆开写

不要只写“使用多种构图”。这一要求过于笼统,模型虽知道需要变化,却不知道应该变化哪些部分。

原文在提示词中直接列出:

  • 上半身特写
  • 下半身特写
  • 正面角度
  • 背面角度
  • 脚下仰拍
  • 近景
  • 远景
  • 俯身动作

生成 8 个版本时,GPT-Image-2 会从这些构图选项中拆分、组合:部分画面使用近景,部分采用低机位仰拍,也可能出现背面或侧后方视角。由此降低多张图片只是在换衣服颜色的概率。

因此,原文建议将:

使用多种拍摄角度。

改为类似:

加入正面、背面、俯拍、仰拍、近景、远景、上半身特写和全身画面。

描述越具体,版本之间的画面差异通常越明显。

固定场景与光线

第二个要点是指定明确地点。原文对比了以下两种写法:

在赛车场拍摄。
拍摄地点为赛车场维修区。

“赛车场”是宽泛地点,可能得到看台、停车场、公路、展厅或普通室外空地;“赛车场维修区”则更容易引入赛车、维修通道、赛道标识、车队设备等背景元素,使画面更有职业感和现场感。

同时补充:

使用明亮的户外自然阳光。

这一要求用于固定时间与光线,避免同批图像混入白天、夜晚、室内或霓虹灯等不同氛围。原文认为,统一场景和光线后,8 张图会更像同一人物、同一活动中的一组镜头,而不是彼此无关的 AI 图像;这类素材可用于账号内容。

用具体动作替代“不同姿势”

“做出不同姿势”同样过于泛泛,可能只得到站立、微笑、双手自然下垂等结果。原文列出的动作包括:

  • 抬起手臂
  • 单手叉腰
  • 俯身
  • 手持遮阳伞
  • 比剪刀手
  • 眨眼

这些简单动作会改变身体姿态和画面重心。批量生成时,动作选项足够具体,模型更容易将它们分配到不同版本,例如一张撑伞、一张比剪刀手、一张叉腰、一张俯身、一张抬手。

原文的建议是:不要只要求 AI“自由发挥”,而要先提供一份动作菜单。

可复用的框架

这套方法的价值不局限于赛车宝贝题材。可将提示词拆分为以下字段:

  1. 人物身份
  2. 服装细节
  3. 身体和外观特征
  4. 景别变化
  5. 拍摄角度
  6. 动作姿势
  7. 固定场景
  8. 固定光线
  9. 生成数量

更换人物、服装与地点,即可转为其他题材,无需每次从零研究提示词。

啦啦队版

用 GPT-Image-2 批量生成 AI 人物图:可复用的提示词框架与题材示例配图 3
生成一组成年女性啦啦队员的图片。画面比例为 3:4,穿超短款啦啦队制服。肤色白皙,腿部修长。包含上半身特写、下半身特写等不同景别。加入抬起手臂、抬腿、从脚下向上仰拍等不同构图。同时包含正面和背面等不同角度。加入近景和远景画面。设计多种不同姿势。拍摄地点为体育馆。使用明亮的室内灯光。改变画面风格,生成 8 种不同版本。

该版本保留原有构图框架,仅将人物身份、服装和拍摄场景替换为啦啦队与体育馆。

女仆版

用 GPT-Image-2 批量生成 AI 人物图:可复用的提示词框架与题材示例配图 4
生成一组成年女仆的图片。穿短款荷叶边女仆装。肤色白皙,腿部修长。包含上半身特写、下半身特写等不同景别。加入回头、俯视、仰视、侧脸等不同构图。包含手持托盘、用手托腮等不同姿势。拍摄地点为咖啡店室内。使用柔和的自然光。改变画面风格,生成 8 种不同版本。

这个示例将重点转为咖啡店、托盘、荷叶边服装及柔和自然光;提示词框架不变,但画面氛围随之改变。

护士版

用 GPT-Image-2 批量生成 AI 人物图:可复用的提示词框架与题材示例配图 5
生成一组成年护士的图片。画面比例为 3:4,穿短款护士服和白色连衣裙式制服。肤色白皙,腿部修长。包含上半身特写、下半身特写等不同景别。加入回头、俯视、仰视、俯身等不同构图。同时包含正面和背面等不同角度。加入近景和远景画面。包含手持病历夹、拿着听诊器、检查输液设备等不同姿势。拍摄地点为医院诊室或走廊。使用明亮的室内灯光。改变画面风格,生成 8 种不同版本。

原文特别提示:若只写“穿护士服”,模型可能生成现代医院常见的分体式护士服,即上衣加长裤。若目标是连衣裙式制服,需要明确写出:

短款护士服、白色连衣裙式制服。

原文将这类偏差归因为提示词没有写清目标,而非单纯认为模型不听话。

更多可替换题材

用 GPT-Image-2 批量生成 AI 人物图:可复用的提示词框架与题材示例配图 6

同一方法还可替换为:

  • 制服
  • 巫女
  • 空乘
  • 女警
  • 展会模特
  • 校园啦啦队
  • 咖啡店店员
  • 舞台表演者

通常只需修改 4 个位置:人物身份、服装、动作道具、拍摄地点。构图、景别、光线及批量生成逻辑可以继续复用。

万能模板

人物身份:

生成一组成年女性【角色】的图片。

服装细节:

穿【服装类型】,突出【具体视觉特征】。

外观特征:

肤色白皙,腿部修长。

景别变化:

包含上半身特写、下半身特写、半身和全身等不同景别。

构图角度:

加入正面、背面、侧面、俯拍、仰拍、近景和远景。

动作姿势:

包含【动作 1】、【动作 2】、【动作 3】等不同姿势。

固定场景:

拍摄地点为【具体地点】。

固定光线:

使用【自然光、室内灯光、夕阳、柔和光线】。

批量生成:

改变画面风格,生成 8 种不同版本。

模板的目的不是单纯把提示词写长,而是提前说明所有可能影响画面的变量。

内容限制范围

原文提醒,GPT-Image-2 对过度裸露及明显色情内容存在内容限制。超短裙、赛车服、泳装、突出腿部比例等正常时尚或写真表达,原文称通常可以正常生成;继续加入露骨描述则可能被拒绝。

其建议是在正常写真和时尚摄影范围内,优先完善构图、动作、场景和光线,而不是反复试探限制。原文认为,这类素材也更适合在 Instagram、Threads 和 X 等公开平台长期发布。

真正难点:从生成图片到运营账号

原文最后强调,能生成图片不等于能变现。仅会生成图片本身并不能带来收入,后续还需要完成整套流程:

  1. 确定账号定位。
  2. 统一人物形象。
  3. 设计内容栏目。
  4. 持续发布。
  5. 获取推荐流量。
  6. 将粉丝导向产品、会员、社群或其他收入渠道。

图片生成只是入口;账号运营和变现路径才是后续重点。同一组 AI 图片,可能只获得几十次浏览,也可能被持续运营成虚拟人物账号。原文认为,差异不在于是否会写复杂提示词,而在于是否具备完整的内容生产与流量转化系统。

原文的结论是:GPT-Image-2 降低了图片生成门槛,拉开差距的将是能否持续使用模板生产内容。

GPT-Image-2AI 绘图提示词内容创作实操笔记