Гайды

Нейросеть для карточек товара: слоты и промпты

Схема карточки товара, где показаны главное фото, галерея, инфографика, рич-контент и текстовые поля, с указанием, какие из них генерирует нейросеть.

Коротко

Нейросеть закрывает три из пяти слотов карточки товара: главное фото, галерею и инфографику. Она помогает обрабатывать снимки, генерировать сцены и создавать инфографику с читаемым текстом. Важно использовать референсы для поддержания единого вида товара и проверять все фактические данные, так как ИИ может их искажать.

Содержание
  1. Какие требования площадки предъявляют к фото?
  2. Из чего состоит карточка и что рисует нейросеть?
  3. Как собрать главное фото товара?
  4. Почему нейросеть коверкает текст на инфографике?
  5. Какое соотношение сторон просить у модели?
  6. Промпт под карточку: скелет и разбор
  7. Как удержать товар одинаковым на всех кадрах?
  8. Сколько стоит собрать одну карточку?
  9. Что нейросети в карточке доверять нельзя
  10. Чек-лист перед загрузкой
  11. Источники

Карточка собирается из слотов, и правила у каждого свои: главное фото, галерея, инфографика, рич-контент, поля с текстом. Нейросеть закрывает часть слотов почти целиком и в остальных бесполезна. Разбираем по слотам, с цифрами площадки и промптами.

Какие требования площадки предъявляют к фото?

Минимум, ниже которого карточку не примут, площадка публикует сама. У Wildberries это разрешение 700×900 пикселей, форматы JPG, PNG и WEBP, качество сжатия не ниже 65% и до 30 фотографий в одной карточке.

ПараметрТребование WildberriesЧто это значит для генерации
Минимальное разрешение700×900 пикселейПросить у модели 2K, а не 1K
ФорматыJPG, PNG, WEBPPNG — если нужен прозрачный фон
Сжатиене ниже 65%Не пережимать после экспорта
Количество фотодо 30 в карточкеХватает на галерею плюс инфографику
Минимум фотохотя бы дваБез фото товар не попадает в поиск

Числа взяты из справки Wildberries для продавцов «Фото товаров: правила, рекомендации и частые ошибки» — страница открыта без входа в кабинет, её стоит держать в закладках. У Ozon и Яндекс Маркета свои значения, и они правятся чаще, чем обновляются подборки в поиске. Открывайте базу знаний своей площадки перед каждой большой партией.

Отдельно площадка перечисляет, чего на фото быть не должно: водяных знаков, чужих логотипов и бирок, маркетингового текста поверх товара, коллажей из нескольких товаров, товара в упаковке на главном кадре. И там же прямым текстом: «Фото неудачно сгенерировано нейросетью — изображение выглядит неестественно, а в тексте есть искажённые символы».

Из чего состоит карточка и что рисует нейросеть?

Слотов пять, и генерация закрывает три из них. Остальные два — работа человека и склада.

Схема карточки товара: главное фото, галерея, инфографика, рич-контент и текстовые поля

Главное фото и галерея — обработка реального снимка: вырезали товар, поставили сцену, вычистили шум. Инфографику модель рисует с нуля по макету, а рич-контент собирает из тех же изображений в последовательность экранов. А вот характеристики и описание модель только черновит: цифры туда вносит селлер. Пятый слот, видео, нейросети пока даётся хуже всего в предметке: товар «плывёт» между кадрами.

Как собрать главное фото товара?

В три прохода: отделить предмет от фона, подставить сцену, поднять резкость. Одним запросом это не делается — каждый проход решает свою задачу и ошибается по-своему.

Первый проход — удаление фона с фото. На выходе PNG с альфа-каналом, товар без окружения. Это не генерация: контур считает сегментатор, форма предмета остаётся ровно той, что была на снимке. Для карточки это принципиально — покупатель должен получить тот же предмет.

Второй — замена фона на новый. Здесь генерация уже работает: белая циклорама, деревянный стол, кухонная столешница. Формулируйте сцену через материал и свет, а не через настроение: «светло-серый бетон, мягкий рассеянный свет слева, мягкая тень под предметом» отрабатывает лучше, чем «стильный минималистичный фон».

Третий — улучшение качества снимка, если исходник снят телефоном при плохом свете. Порядок менять не стоит: если сначала поднять резкость, сегментатор потом цепляется за усиленный шум по контуру и оставляет рваный край.

Почему нейросеть коверкает текст на инфографике?

Потому что большинство моделей рисует буквы как узор, а не как текст. Это отдельная способность, и она появилась в моделях изображений только в последних поколениях.

В документации Gemini API «продвинутый рендеринг текста» вынесен в список возможностей отдельной строкой: модель делает читаемые подписи для инфографики, меню и диаграмм. Google в анонсе Nano Banana Pro называет gemini-3-pro-image своей лучшей моделью для корректно отрисованного текста прямо в изображении — от короткой строки до целого абзаца, с выводом в 2K и 4K. Предыдущее поколение gemini-2.5-flash-image на подписях длиннее пары слов всё ещё ломает символы.

Практический вывод: плашки с цифрами и составом рисуйте моделью, которая заявляет рендер текста, а всё остальное можно делать чем угодно. И проверяйте каждую надпись глазами — площадка отдельным пунктом заворачивает искажённые символы в тексте.

Какое соотношение сторон просить у модели?

Вертикальное 3:4 — оно попадает в пропорции карточки на всех крупных площадках и с запасом перекрывает минимум 700×900.

Сравнение соотношений сторон 3:4 и 1:1 в карточке товара на экране телефона

Документация Gemini API перечисляет доступные соотношения явно: 1:1, 3:2, 2:3, 3:4, 4:3, 4:5, 5:4, 9:16, 16:9, 21:9. Разрешения — 512 пикселей, 1K, 2K и 4K, причём облегчённая модель умеет только 1K. Берите 3:4 в 2K: получите картинку заведомо крупнее минимума площадки, а лишнее уберёте кадрированием без потери качества.

Если генерируете через API OpenAI, ограничения другие и их стоит знать заранее. Документация по генерации изображений задаёт рамку для gpt-image-2: максимальная сторона не больше 3840 пикселей, обе стороны кратны 16, отношение длинной стороны к короткой не больше 3:1, общее число пикселей от 655 360 до 8 294 400. И там же прямо сказано, что прозрачный фон эта модель не поддерживает — параметр background: "transparent" для неё не принимается.

Промпт под карточку: скелет и разбор

Промпт под предметку строится из пяти блоков, и порядок в нём важнее красоты формулировок.

Скелет: «[что за предмет и его материал] на [фон: цвет, фактура]. Свет: [направление и мягкость]. Ракурс: [фронтальный / три четверти / сверху]. Тень: [мягкая под предметом / отсутствует]. Кадр вертикальный 3:4, товар занимает [40–60]% высоты кадра, вокруг свободное поле. Без текста, без логотипов, без водяных знаков».

Последнюю строку не выбрасывайте. Модели любят дорисовывать на упаковку выдуманные надписи и значки, а это ровно то, что модерация вырезает. Запрет на текст в промпте снимает половину отказов на главном фото.

Готовые связки промптов под предметную съёмку и макеты лежат в галерее примеров инфографики — оттуда удобно брать заготовку и менять под свой товар.

Как удержать товар одинаковым на всех кадрах?

Референсами. Модель принимает исходные снимки товара и держит его вид от кадра к кадру, поэтому серию нужно генерировать не с нуля, а от фотографии.

Пределы описаны в документации Gemini API: gemini-3-pro-image работает с шестью изображениями объектов и пятью персонажами одновременно, а gemini-3.1-flash-lite-image принимает до 14 изображений объекта. На практике для одной карточки хватает трёх-четырёх ракурсов исходника: фронт, три четверти, деталь фактуры.

Типичная ошибка — генерировать каждый кадр отдельным запросом без референса. Тогда на пятом изображении у чайника меняется форма носика, и покупатель видит в галерее два разных товара.

Сколько стоит собрать одну карточку?

Порядок такой: обработка одного кадра обходится в десятки токенов, полный комплект на карточку — в сотни. Удаление фона стоит 30 токенов, замена фона — 90 токенов, улучшение снимка — 90 токенов, генерация картинки с нуля — 30 токенов.

Готовая карточка товара на маркетплейсе с инфографикой, собранная нейросетью

Считаем комплект: пять кадров с удалением фона, три сцены, один прогон на резкость, две инфографики — около 700 токенов на карточку. Отладив промпт на первом товаре, дальше вы меняете в нём название и цвет, и стоимость партии становится предсказуемой.

Приветственного бонуса хватает, чтобы собрать первую карточку целиком до оплаты. Нужна регистрация с подтверждением почты, дальше — рубли и никакого VPN.

Что нейросети в карточке доверять нельзя

Всё, что покупатель потом сверит с товаром в руках: состав, габариты, вес, комплектацию, сроки, номера сертификатов и маркировку.

Есть и вторая граница, менее очевидная. Сгенерированный ракурс, которого у товара не существует, формально проходит по всем техническим требованиям — и всё равно вредит. Покупатель заказывает то, что увидел, получает другое и оставляет отзыв на единицу. Обзор остальных задач селлера, включая работу с этими отзывами, мы собрали в статье про нейросеть для маркетплейса.

Чек-лист перед загрузкой

Пройдите по нему до того, как отправите карточку на модерацию.

  1. Разрешение каждого кадра не ниже минимума площадки, вертикаль 3:4.
  2. Формат JPG, PNG или WEBP, файл не пережат после экспорта.
  3. На главном фото один товар, не в упаковке, без коллажа.
  4. Ни водяных знаков, ни чужих логотипов, ни бирок.
  5. Каждая надпись на инфографике прочитана глазами по буквам.
  6. Форма и цвет товара совпадают с реальным на всех кадрах.
  7. Характеристики и описание сверены со спецификацией поставщика.
  8. В карточке не меньше двух фотографий.

Источники

Поделиться: TelegramVKWhatsApp

Частые вопросы

Какие требования к фото на Wildberries?+

Wildberries требует разрешение не ниже 700×900 пикселей, форматы JPG, PNG или WEBP, качество сжатия не ниже 65% и до 30 фотографий в одной карточке. На главном фото не должно быть водяных знаков, чужих логотипов, маркетингового текста, коллажей или товара в упаковке.

Как нейросеть делает главное фото?+

Главное фото собирается в три прохода: сначала удаляется фон с реального снимка, затем подставляется новая сцена с помощью генерации, и в конце улучшается качество снимка при необходимости. Каждый проход решает свою задачу, и их порядок важен для достижения наилучшего результата.

Почему нейросеть коверкает текст на инфографике?+

Большинство моделей рисует буквы как узор, а не как текст. Это отдельная способность, которая появилась только в последних поколениях моделей изображений, таких как `gemini-3-pro-image`. Важно использовать модели, заявляющие продвинутый рендеринг текста, и всегда проверять надписи глазами.

Какое соотношение сторон выбрать для карточки?+

Рекомендуется использовать вертикальное соотношение сторон 3:4. Оно подходит для всех крупных площадок и с запасом перекрывает минимальные требования к разрешению, например 700×900 пикселей. Лучше генерировать изображения в 2K, чтобы иметь запас для кадрирования без потери качества.

Попробуйте прямо сейчас

Без VPN и зарубежных карт — оплата в рублях, первый шаг за минуту.

Попробовать модели в Trackly