· 作者 三四八方 · 更新于
用 GPT-Image-2 批量生成 AI 人物图:可复用的提示词框架与题材示例
用一套可替换角色、服装、动作与场景的中文提示词模板,批量生成具有不同景别、角度和姿势的 AI 人物图,并了解公开发布与后续账号运营的注意点。
原始来源:X @wanerfu

原文围绕 GPT-Image-2 的一轮测试提出:批量生成 AI 人物图时,不必依赖摄影术语、镜头参数或大量关键词;更重要的是用清晰的自然语言交代人物、服装、构图、场景和光线。这样可以一次得到多组有明显差异的画面,并可将同一框架替换为啦啦队、女仆、护士等题材。
先看测试结论

原文以成年女性赛车宝贝为例:未使用摄影流派、光圈或焦段等术语,而是明确指定服装、地点、拍摄角度与动作,最终要求生成 8 种不同版本。
这 8 组画面不只是更换背景或颜色,而包含不同景别、视角和姿势。原文据此判断,GPT-Image-2 更依赖明确、具体的描述,而非堆叠看似专业的关键词。
完整提示词
原文使用的提示词如下:
生成一组成年女性赛车宝贝的图片。画面比例为 3:4,穿超短款赛车服,服装设计突出上半身线条和腿部比例。肤色白皙,腿部修长。包含上半身特写、下半身特写等不同景别。加入抬起手臂、单手叉腰、俯身、从脚下向上仰拍等不同构图。同时包含正面、背面等不同角度。加入近景和远景画面。包含手持遮阳伞、比剪刀手、眨眼等不同姿势。拍摄地点为赛车场维修区。使用明亮的户外自然阳光。改变画面风格,生成 8 种不同版本。
这段提示词由日常可理解的描述组成,例如超短赛车服、白皙腿部、维修区、户外阳光、正面、背面、远景与近景。原文认为,效果关键不在某个单独的“神奇关键词”,而在信息的组织方式。
将构图要求拆开写
不要只写“使用多种构图”。这一要求过于笼统,模型虽知道需要变化,却不知道应该变化哪些部分。
原文在提示词中直接列出:
- 上半身特写
- 下半身特写
- 正面角度
- 背面角度
- 脚下仰拍
- 近景
- 远景
- 俯身动作
生成 8 个版本时,GPT-Image-2 会从这些构图选项中拆分、组合:部分画面使用近景,部分采用低机位仰拍,也可能出现背面或侧后方视角。由此降低多张图片只是在换衣服颜色的概率。
因此,原文建议将:
使用多种拍摄角度。
改为类似:
加入正面、背面、俯拍、仰拍、近景、远景、上半身特写和全身画面。
描述越具体,版本之间的画面差异通常越明显。
固定场景与光线
第二个要点是指定明确地点。原文对比了以下两种写法:
在赛车场拍摄。
拍摄地点为赛车场维修区。
“赛车场”是宽泛地点,可能得到看台、停车场、公路、展厅或普通室外空地;“赛车场维修区”则更容易引入赛车、维修通道、赛道标识、车队设备等背景元素,使画面更有职业感和现场感。
同时补充:
使用明亮的户外自然阳光。
这一要求用于固定时间与光线,避免同批图像混入白天、夜晚、室内或霓虹灯等不同氛围。原文认为,统一场景和光线后,8 张图会更像同一人物、同一活动中的一组镜头,而不是彼此无关的 AI 图像;这类素材可用于账号内容。
用具体动作替代“不同姿势”
“做出不同姿势”同样过于泛泛,可能只得到站立、微笑、双手自然下垂等结果。原文列出的动作包括:
- 抬起手臂
- 单手叉腰
- 俯身
- 手持遮阳伞
- 比剪刀手
- 眨眼
这些简单动作会改变身体姿态和画面重心。批量生成时,动作选项足够具体,模型更容易将它们分配到不同版本,例如一张撑伞、一张比剪刀手、一张叉腰、一张俯身、一张抬手。
原文的建议是:不要只要求 AI“自由发挥”,而要先提供一份动作菜单。
可复用的框架
这套方法的价值不局限于赛车宝贝题材。可将提示词拆分为以下字段:
- 人物身份
- 服装细节
- 身体和外观特征
- 景别变化
- 拍摄角度
- 动作姿势
- 固定场景
- 固定光线
- 生成数量
更换人物、服装与地点,即可转为其他题材,无需每次从零研究提示词。
啦啦队版

生成一组成年女性啦啦队员的图片。画面比例为 3:4,穿超短款啦啦队制服。肤色白皙,腿部修长。包含上半身特写、下半身特写等不同景别。加入抬起手臂、抬腿、从脚下向上仰拍等不同构图。同时包含正面和背面等不同角度。加入近景和远景画面。设计多种不同姿势。拍摄地点为体育馆。使用明亮的室内灯光。改变画面风格,生成 8 种不同版本。
该版本保留原有构图框架,仅将人物身份、服装和拍摄场景替换为啦啦队与体育馆。
女仆版

生成一组成年女仆的图片。穿短款荷叶边女仆装。肤色白皙,腿部修长。包含上半身特写、下半身特写等不同景别。加入回头、俯视、仰视、侧脸等不同构图。包含手持托盘、用手托腮等不同姿势。拍摄地点为咖啡店室内。使用柔和的自然光。改变画面风格,生成 8 种不同版本。
这个示例将重点转为咖啡店、托盘、荷叶边服装及柔和自然光;提示词框架不变,但画面氛围随之改变。
护士版

生成一组成年护士的图片。画面比例为 3:4,穿短款护士服和白色连衣裙式制服。肤色白皙,腿部修长。包含上半身特写、下半身特写等不同景别。加入回头、俯视、仰视、俯身等不同构图。同时包含正面和背面等不同角度。加入近景和远景画面。包含手持病历夹、拿着听诊器、检查输液设备等不同姿势。拍摄地点为医院诊室或走廊。使用明亮的室内灯光。改变画面风格,生成 8 种不同版本。
原文特别提示:若只写“穿护士服”,模型可能生成现代医院常见的分体式护士服,即上衣加长裤。若目标是连衣裙式制服,需要明确写出:
短款护士服、白色连衣裙式制服。
原文将这类偏差归因为提示词没有写清目标,而非单纯认为模型不听话。
更多可替换题材

同一方法还可替换为:
- 制服
- 巫女
- 空乘
- 女警
- 展会模特
- 校园啦啦队
- 咖啡店店员
- 舞台表演者
通常只需修改 4 个位置:人物身份、服装、动作道具、拍摄地点。构图、景别、光线及批量生成逻辑可以继续复用。
万能模板
人物身份:
生成一组成年女性【角色】的图片。
服装细节:
穿【服装类型】,突出【具体视觉特征】。
外观特征:
肤色白皙,腿部修长。
景别变化:
包含上半身特写、下半身特写、半身和全身等不同景别。
构图角度:
加入正面、背面、侧面、俯拍、仰拍、近景和远景。
动作姿势:
包含【动作 1】、【动作 2】、【动作 3】等不同姿势。
固定场景:
拍摄地点为【具体地点】。
固定光线:
使用【自然光、室内灯光、夕阳、柔和光线】。
批量生成:
改变画面风格,生成 8 种不同版本。
模板的目的不是单纯把提示词写长,而是提前说明所有可能影响画面的变量。
内容限制范围
原文提醒,GPT-Image-2 对过度裸露及明显色情内容存在内容限制。超短裙、赛车服、泳装、突出腿部比例等正常时尚或写真表达,原文称通常可以正常生成;继续加入露骨描述则可能被拒绝。
其建议是在正常写真和时尚摄影范围内,优先完善构图、动作、场景和光线,而不是反复试探限制。原文认为,这类素材也更适合在 Instagram、Threads 和 X 等公开平台长期发布。
真正难点:从生成图片到运营账号
原文最后强调,能生成图片不等于能变现。仅会生成图片本身并不能带来收入,后续还需要完成整套流程:
- 确定账号定位。
- 统一人物形象。
- 设计内容栏目。
- 持续发布。
- 获取推荐流量。
- 将粉丝导向产品、会员、社群或其他收入渠道。
图片生成只是入口;账号运营和变现路径才是后续重点。同一组 AI 图片,可能只获得几十次浏览,也可能被持续运营成虚拟人物账号。原文认为,差异不在于是否会写复杂提示词,而在于是否具备完整的内容生产与流量转化系统。
原文的结论是:GPT-Image-2 降低了图片生成门槛,拉开差距的将是能否持续使用模板生产内容。