公司动态

一张商品图生成整套Amazon Listing视觉方案:6张图+3套视频脚本全流程

📅 2026/9/3 1:54:22
一张商品图生成整套Amazon Listing视觉方案:6张图+3套视频脚本全流程
把一张原始商品图变成一套完整的 Amazon Listing 视觉方案这件事听起来像是“把图丢进 AI多等几分钟就全出来了”实际上真正跑起来要拆成两半看一半是静态图负责主图、卖点图、场景图和尺寸图另一半是动态内容更准确的叫法是“视频脚本 镜头分镜 静态图素材”也就是视频方案。先说结论单靠一张图能做到“6 张 Listing 图 3 套可用于视频制作的完整方案”但前提是先把产品一致性、输出规格、镜头语言和验收标准定清楚否则生成出来的图很好看却挂不上链接视频方案也只是看起来专业实际无法复拍。这篇文章我会按实际执行顺序拆先讲从一张商品图里能提取哪些有效信息再讲怎么保证 6 张图看起来是同一个产品接着给三套视频方案的组织方法最后留一份我自己排查时会优先看的清单。如果你是想省拍摄预算、准备上新品或者正在批量处理店铺视觉这篇文章的流程可以直接照着走一遍。1. 先拆需求6 张图不是随便 6 张3 套视频方案也不是 3 个视频1.1 亚马逊标准 listing 图到底要哪几张很多人以为“6 张图”是生成 6 个不同角度就完事实际上亚马逊的商品主图区有固定结构通常由这几类组成主图纯白底产品占画面 85% 左右不能有文字、水印、边框和模特以外的元素。功能卖点图突出某个具体功能比如防水、容量、材质、拆卸方式。尺寸图用标注或比例图形表达尺寸常见的是产品旁边放一把尺子、刻度线或文字标注。细节图近距离展示材质纹理、接口、缝线或内部结构。场景图产品出现在真实使用环境中比如咖啡杯放在办公桌上、户外灯挂在帐篷前。生活方式图强调人与产品的互动比如手拿杯子、背包装在自行车上、宠物在使用垫子。所以“6 张图”要覆盖的不是六个角度而是六种信息类型。生成之前先把这六类写进任务清单里再决定每张图用什么提示词、什么构图、什么光线。这个顺序不能反过来。1.2 3 套视频方案是什么含义视频方案不是最终视频而是“如果今天就要开始拍或生成视频用什么逻辑组织素材”。在亚马逊前后台上传视频时视频内容通常分为三类表达方向卖点展示型产品 360 度环绕配合功能特写比如瓶盖的密封圈、背包的防水拉链、灯具的亮度切换。使用场景叙事型有人物、有过程、有结果比如早上起床用咖啡机、带折叠椅去露营、用清洁剂擦完台面。对比验证型没有产品时很麻烦有产品后变简单或者同类产品细节对比突出自己这边更稳、更清晰、更容易操作。这三类方向本质上就是三套镜头脚本。准备素材时不需要一开始就跑视频生成先把每个方案对应的分镜写出来再判断哪些镜头由实拍提供、哪些由静态图生成动态视频。这样后面跑视频工具、喂镜头提示词、控制时长都会轻松很多。1.3 一张原始商品图能提供哪些“确定性信息”我见过不少团队拿到一张白底产品图就开始写提示词结果生成出来的图“很好看但不是我的产品”。问题出在没先提取图里的确定性信息。一张原始商品图里至少有这些可识别特征产品外形包括轮廓、比例、关键结构。颜色和材质纯黑磨砂、银色金属、透明塑料这些是光线模拟的基础。标志、接口、按钮、开口位置。握持方向和使用方向判断左右手或正面背面。包装形式如果产品是盒装或瓶装背景虚化也应该保持包装比例。不要把这些信息写进一句很长的提示词里就完事。更好的做法是先把产品主体从原图里抠出来生成透明底 PNG再用这个透明底图作为参考图交给图像生成工具去扩展背景、添加场景、设置人物动作。这样每一步生成都围绕“同一个主体”展开而不是靠模型自己猜。2. 一致性是核心先从透明底图和主体参考开始2.1 第一步永远先抠图不是先写提示词原始商品图可能是白底也可能是实拍场景。不管哪张都要先得到一张高质量的透明底产品图。原因很简单透明底图是后续所有步骤的“根”。背景可以随时换但产品主体一旦被重新生成就会出现颜色偏移、标志消失、把手变粗这类问题。推荐流程原始商品图 - 抠图/分割 - 透明底 PNG - 细节检查 - 生成背景变体透明底 PNG 的分辨率和光线很重要。建议先输出一个边长不低于 1024 像素的版本并且保证边缘平滑不要有明显白边。背景换成深色时白边会被放大这是很多 AI 电商图一眼假的主要原因。抠图阶段我习惯优先用可编辑的方式而不是一键自动抠完就结束。至少检查三个部位产品底部与地面的接触线、手柄或挂绳周围的缝隙、半透明材质的边缘。这三个位置最容易残留背景色。2.2 使用参考图让每一次生成都用同一个产品现代图像生成工具大多支持参考图输入。最常见的两种模式是“主体参考”和“风格参考”。主体参考决定产品长什么样风格参考决定画面整体调性。这一步非常关键因为直接写提示词无法约束产品身份。实际操作时我会在每张 Listing 图的生成参数里同时放两张参照图一张是透明底产品图用来锁定外形、材质、标志。一张是目标风格示例比如“办公桌面场景构图”“浅灰色现代家居背景、自然光”。生成后还要做一次“主体比对”把新产出的图里的产品区域和原图透明度版本叠加查看重点看轮廓比例、字体位置、颜色色值是不是接近。不要只看第一眼顺不顺眼要看它是不是同一个东西。2.3 提示词结构怎么写主体 环境 光线 构图 后期限制如果要生成一张生活方式图提示词不应该是“a person using cup on desk”这么简单。熟练写手一般会把提示词拆成五段主体描述透明底产品图参考中的同款产品保持外形、颜色、材质一致 环境描述现代办公桌木纹桌面白色背景墙柔和自然光 动作/互动一只手拿杯子边缘另一只手敲键盘人物只露出前臂 光线/镜头35mm 镜头浅景深上午侧光阴影柔和 后期限制真实摄影风格无文字无水印无变形这样的结构不会让 AI 自由发挥失控。不同工具对提示词理解能力不同但这个拆法可以套用到大多数工具里。重点不是写得长而是每一段都在做“限定”。3. 六张图的生成顺序从严谨到风格3.1 第一张白底主图先把最严格的做了白底主图是最容易做也最容易被忽略的图。它的验收标准很清楚背景纯白RGB 大约在 255,255,255。产品居中占画面 80% 到 85%。没有品牌水印、促销文字、边框。产品影子要自然不能出现明显背景分界线。生成白底图时我一般会把透明底 PNG 直接放到白色画布上再做一次柔和投影。如果 AI 直接生成白底图容易出现“背景不够白、地板反射过强、产品边缘虚化”等问题。最稳的方式是透明底 PNG 叠加白色背景再统一调色而不是靠提示词生成纯白背景。这一步的输出文件可以细分一张白底原图、一张带轻微投影版本、一张透明底版本。后面做场景图时透明底版本继续复用。3.2 主图到功能卖点图加标签但别让标签盖住产品功能卖点图是最需要人工介入的环节。AI 生成出的产品通常会完整但 AI 生成出的“文字标签”基本没法直接用于正式链接。正确流程是先让 AI 只生成产品特写区域文字留空。把图片导入修图工具人工添加箭头、圆圈、英文简短文案。再统一调整字体和排版。如果工具支持“文字区域留白”或“负向提示词”一定要用上。比如生成保温杯密封圈功能图时可以在画面里预留一块干净的空白区域后期自己加“Vacuum Insulation”这样的文案。否则 AI 会生成乱码文字做出来的图很容易被亚马逊审核标记。3.3 场景图和生活方式图由近到远加信息场景图和生活方式图不需要太规矩但也不能完全脱离产品。我建议按“由近到远”的顺序生成第一张是近景功能特写第二张是产品在场景中的中景第三张才让模特或环境占更大比例。这样做的原因是信息量越大AI 越容易修改产品外形。越早接近产品生成失败的概率越低。场景图生成时产品在画面中的比例尽量别低于 30%。低于这个比例后产品往往会被当作配角细节全被环境吞掉。你可以通过参考图工具锁定主体但最终控制权还是在画面构图里。3.4 输出规格和批量命名六张图生成后不要直接丢进原图文件夹里。要按亚马逊链接结构的顺序统一命名方便上传和后续返工。例如main.png detail_01.png feature_01.png scale_01.png lifestyle_01.png scene_01.png还有一个容易被忽略的点亚马逊对图片长宽比和像素有建议。制作时先确认当前店铺所在站点的要求。我一般会让主图用正方形构图长边至少 1600 像素方便缩放后仍然清晰。场景图可以按需求做成 4:5 或 1:1但不要混着一堆比例上传会导致前台展示自动裁切。4. 三套视频方案的正确组织方式4.1 方案 A产品展示型先解决“基础素材”第一套视频方案的核心是“让买家看清产品”。它适合作为商品页主视频或广告前 5 秒。镜头结构建议按这个顺序全景白底产品缓慢旋转或静止展示。推近到产品中上部展示核心部件。切换角度展示背面或底部。回到白底全景品牌或功能文字淡入。如果只用一张静态商品图做这套方案最稳的做法是先通过图像生成或剪辑软件制作 360 度轨道效果再把产品从六张图里对应部分切出来做镜头切源。不要直接让视频生成模型从原图随机发挥那样很容易出现产品从中间变形的情况。4.2 方案 B场景叙事型重点写“谁在什么场景用”第二套视频方案解决“代入感”。比如一个保温杯方案 B 的内部脚本文案可以是00:00-00:03 清晨桌面手拿起保温杯倒入咖啡 00:04-00:08 杯盖扭紧特写滴水的密封圈细节 00:09-00:13 人物出门背包侧袋插入保温杯 00:14-00:18 到达办公室把保温杯放在电脑旁镜头后拉这一套方案生成难度比方案 A 大因为涉及人物动作。实操时建议把长视频拆成 3 到 5 秒一条的短片分别生成再剪辑拼接。这样比一次性生成完整 15 秒视频更容易控制节奏也更容易替换某个失败镜头。4.3 方案 C对比验证型适合广告和主图视频补充第三套方案核心是“制造冲突”比如“没有收纳支架 vs 有收纳支架”“旧款沾油污 vs 新款一擦干净”。这套方案由两组镜头组成很容易从一张静态商品图扩展成左右分屏左屏没有产品的场景混乱、费力、不方便。右屏有产品后的场景整洁、高效、轻松。中间过渡产品从左侧滑到右侧或从透明背景悬浮出现。用 AI 做对比视频时最麻烦的是左右两屏风格不统一。建议把两张静态对比图先生成好分别做轻微运镜再放进剪辑工具里做分屏过渡。这样背景色和灯光不会差太多也方便加字幕。4.4 视频生成的输入顺序图像一致文本控制动作时长分开跑视频生成工具一般支持“第一帧图 运动提示词”或“参考人物 参考产品”两种模式。我建议用“第一帧图 局部运动”的方式而不是完全依赖文本描述整段动作。输入顺序可以固定为选择一张质量最高的静态图作为首帧通常是场景图或生活方式图。明确运动范围比如“镜头缓慢推进人物手部静止背景光线不变”。一次只生成 3 到 5 秒不要生成长视频。生成后检查是否出现多手、产品变形、字幕污染。合格片段进入剪辑不合格片段立刻替换出发图。这套流程能大幅减少返工。视频生成模型对静态图的理解往往比文字更稳定先把首帧解决后续镜头跑偏概率会低很多。5. 资源占用、成本和迭代节奏5.1 不同环境下的配置差异很多人关心这套流程对电脑配置要求高不高。分两种情况看如果只用在线图像生成和在线视频生成工具本地只需要一台能开浏览器的电脑内存和显存不是主要瓶颈重点是图片上传速度和网络稳定性。如果要跑本地部署的 Stable Diffusion 或 ComfyUI 工作流就需要独立显卡和足够显存。常见环境里显存 8G 左右可以跑基础图像生成但批量生成 6 张 1024 分辨率图片时等待时间会明显拉长如果还要跑视频生成显存 12G 以上才会更从容。低配置机器不是不能做但要把分辨率、批量数、单次生成时长都降下来。核心思路是先生成小尺寸构图选中满意的再放大不要一上来就拉满 2K 出图。5.2 预算要根据“返工率”来算AI 素材制作的实际成本不能只看生成次数要看“有效命中率”。比如生成 10 张场景图真正进入整理环节的只有 3 张那成本就要按 10 次来算。建议在项目开始前锁定一个返工预算单张图生成验证 3 次以内不要无限调整。每个视频方案最多准备两版镜头节奏。如果连续 5 次都发生产品变形优先换首帧素材不要继续调提示词。你如果按这个节奏跑一遍“1 张商品图到 6 图 3 方案”通常能控制在一个可预期的时间范围内。如果中间一直纠结“生成的图能不能直接用”时间会被拖成两倍以上。5.3 哪个环节最值得人工精修三个环节不建议完全交给 AI产品主体透明底抠图阶段要人工复核边缘这里错了后面全错。文字标签AI 生成文字不可控正式链接上必须人工重做。视频字幕视频生成模型生成的文字更不稳定尽量剪辑时加字幕层。其他环节比如背景氛围、光线风格、颜色统一AI 工具通常做得比人工快这也是这套流程能压缩时间的基础。6. 常见问题和排查思路按优先级排列6.1 产品被 AI 改形、改标志、改颜色这个问题最多见。出现时不要马上重写提示词先检查参考图是否清晰、透明底图是否规格统一。如果参考图本身是斜拍角度AI 很容易把产品理解成另一个形状。先把参考图裁剪成主体干净、正对镜头、边缘完整的版本再跑。6.2 背景干净但产品边缘有明显处理痕迹这种问题通常出在透明底抠图阶段。毛发、柔性材质、半透明边缘残留底色换到复杂场景后会被放大。解决方法是用专业分割工具或多花点时间人工修边缘而不是在生成阶段加“干净边缘”提示词。6.3 生成的场景图“很好看但氛围不像电商图”电商图的核心是“产品清楚、信息直接”氛围可以好但不能盖过产品识别。场景图生成后把画面缩小到手机屏幕尺寸看一遍如果第一眼看不到产品在哪就说明产品比例太低或背景对比度太强。建议回到构图调整产品占比和背景颜色。6.4 视频生成后产品在前后帧不一致这是视频方案里最常见的问题。优先检查每一段视频的首帧是否来自同一个产品主体。不要用两张从不同场景生成的图拼接成同一段视频。更稳妥的做法是先把透明底产品图贴进统一的简单背景里再去生成运动镜头这样前后一致的概率会高很多。6.5 输出结果被平台判断为“低质量带文字图”很多卖家忽略亚马逊对图片文字的规范。AI 生成时会产生乱码英文字母这些会影响点击率也可能被平台审核识别为“尴尬内容”。统一原则是AI 图里不要带任何正式文字。所有说明性文字由人工后期添加这样既干净又可控。7. 落地清单和最后的执行建议7.1 6 张 Listing 图验收清单在提交链接或正式制图前我会按下面这张表逐项检查[ ] 是否有透明底 PNG分辨率足够 [ ] 主图背景为纯白色无文字、无水印 [ ] 产品外形是否与原图一致颜色没有偏差 [ ] 功能图上是否有人工重新制作的说明文字 [ ] 尺寸图中比例标注是否准确 [ ] 场景图和生活方式图里产品占比不低于 30% [ ] 六张图命名清晰比例统一无乱码文件名 [ ] 缩略图状态下仍能一眼看清产品不要小看缩略图检查。很多图在大图预览时很精致缩到 200 像素后产品就像被背景吞掉了。这个标准最好在整个流程里保持。7.2 三套视频方案验收清单视频方案暂时不需要达到“成片级”但至少要满足“可以进入剪辑”首帧图有明确产品主体每个镜头时长可拆分运动幅度合理字幕文案已经写好。我的判断标准是一个方案要在 5 分钟内让别人看懂镜头逻辑否则说明分镜写得还不够清楚。7.3 最终建议先单条跑通再批量复制如果你准备拿这套链路做多产品批量生产我的建议是先拿一个核心产品完整跑通六张图和三个视频方案中间所有失败记录保存起来第二次做同类产品时就按第一轮沉淀的提示词模板、参考图结构、视频分镜表来复用。不要第一天就从 50 个产品开始批量生成那样只会收获一堆无法统一使用的半成品。踩过几次之后你会发现大多数问题不是 AI 能力不够而是前置素材没有处理干净镜头结构没有提前定义清楚。把这两块先补牢一张图变出整套 amazon 视觉方案的流程才能真正稳定复制。