2026-09-28
AI改图,终于懂点「用户心理学」了
一张电商图片,既要准确展示商品,也要契合用户喜好,更承载着价值转化的商业期待。当图像编辑开始读懂用户偏好,模型能否将不同的创作意图转化为合心意、可使用的电商素材,进一步激发商业价值潜能? 快手技术团队推出 KwaiMind,一套面向真实电商内容生产的图像编辑基座模型。 融合通用图像编辑与电商专项能力,在保留商品细节、准确呈现文字的同时,满足多样化创作需求,并配套构建电商任务评测体系,形成从数据生产、模型训练到效果评估与业务反馈的完整闭环。 据技术报告披露,KwaiMind 在多项通用图像编辑基准上取得参评开源模型综合得分第一;在自建电商评测 Ecom-Bench 中,视觉总分位居参评开源模型第一。 线上商品主图素材优选 A/B 实验中,KwaiMind 带来实际点击率相对提升约 2.44% ,展现了电商图像编辑的商业应用潜力。 图 1 Ecom-Bench 视觉总分与 Ecom-CTR 排名比较。CTR 为预测排名累计计数。 从通用编辑到定向修复,覆盖真实素材生产需求 KwaiMind 将增删、替换、构图调整和局部问题修复纳入同一套指令式编辑能力,支持服装试穿、商品细节展示、配饰佩戴、背景替换、动作调整等任务。商家可以围绕已有素材提出展示需求,也可以针对文字、背景等局部问题进行定向修改。 图 2 KwaiMind 编辑案例,涵盖服装、配饰、商品场景和通用图像编辑。 以电商卖点图为例,模型需要根据商品图与编辑指令调整背景和构图并进行文字的渲染,在突出商品视觉表现的同时,保持其外观、材质与关键细节的一致性。这些要求也考验模型的通用编辑能力。KwaiMind 在适配电商场景的同时,也展现出较强的通用编辑能力,在多个通用基准测试中均优于本报告中其他参评的开源模型。 图 3 KwaiMind 在四组通用编辑评测中均取得参评开源组最高总体得分。 四项智能体协作,维护约 180 万对高质量训练样本 电商素材规模庞大、来源多样,既需保障质量,也需适配不同任务。传统流程依赖反复筛选、修改和复核,成本高、效率低,标准也难统一。为此,KwaiMind 构建了多智能体数据引擎,将质量过滤、样本修复、定向补充与指令标注整合为统一流程,实现任务自动流转、样本状态可追踪。四类智能体分工如下: Filter Agent :预筛输入图像,复筛编辑结果; Generation Agent :根据诊断修复可恢复样本,补充覆盖不足的任务数据; Caption Agent :生成不同粒度的编辑指令; Coordinator Agent :维护样本状态与分布,统筹任务调度、流程衔接及重试。 系统同时引入 Human-in-the-Loop 机制,将低置信、高分歧样本交由人工审核,审核结果回流数据生产流程,兼顾处理效率与数据质量。 图 4 精选 SFT 数据的任务构成及代表性样本。 多智能体数据引擎从约 2,620 万对候选数据中构建并维护约 180 万对高质量训练样本,供 Continued Fine-tuning 阶段使用。进一步精选约 23.49 万对数据用于 SFT 阶段,包括 11.5 万对通用编辑样本和 11.99 万对电商样本。通用数据夯实模型的基础编辑能力,电商数据则围绕服装细节、商品展示和文字编辑等强化专项能力,共同提升模型的指令遵循度与图像美观度。 专项优化与多教师蒸馏,整合为统一基座 真实电商任务往往要求模型同时做好多件事:执行编辑指令、保留商品细节、写对文字,并生成更能吸引用户关注的画面。这些目标的优化难度和收敛节奏并不相同,直接混合训练可能产生干扰,依次优化又可能遗忘已有能力。 KwaiMind 为此采用了一套结合 专项能力优化与多教师蒸馏 的训练方案:在通用编辑能力之上,模型进一步强化视觉质量、商品一致性、文字准确性以及商业点击吸引力。再通过 DiffusionOPD 将不同专家的能力汇聚到统一模型。 图 5 训练框架与 DiffusionOPD 多教师蒸馏。专项教师在学生自身的去噪轨迹上提供指导。 DiffusionOPD 是一种在线蒸馏策略,由教师沿学生的去噪轨迹逐步指导,使能力迁移更贴近学生实际的生成过程。KwaiMind 将通用编辑、文字处理、商品细节保留与用户偏好整合到同一模型中,让一次编辑兼顾多项要求,例如更换背景时保留包装细节与文字,同时生成更符合用户偏好的展示效果。 Ecom-Bench:系统定义电商任务与评测体系 电商图像编辑需要明确的任务边界,也需要一套能够判断素材是否可用的评价标准。 为此,团队构建 Ecom-Bench ,包含 11 项任务、1,100 个案例,每项任务 100 个案例。这些任务包含了虚拟试穿、服装细节、姿态调整等模特穿戴任务,背景替换、商品提取、卖点展示等海报相关任务,以及文字编辑、宣传语去除等文字任务