Нейросеть для карточек товара: слоты и промпты

Коротко
Нейросеть закрывает три из пяти слотов карточки товара: главное фото, галерею и инфографику. Она помогает обрабатывать снимки, генерировать сцены и создавать инфографику с читаемым текстом. Важно использовать референсы для поддержания единого вида товара и проверять все фактические данные, так как ИИ может их искажать.
Содержание
- Какие требования площадки предъявляют к фото?
- Из чего состоит карточка и что рисует нейросеть?
- Как собрать главное фото товара?
- Почему нейросеть коверкает текст на инфографике?
- Какое соотношение сторон просить у модели?
- Промпт под карточку: скелет и разбор
- Как удержать товар одинаковым на всех кадрах?
- Сколько стоит собрать одну карточку?
- Что нейросети в карточке доверять нельзя
- Чек-лист перед загрузкой
- Источники
Карточка собирается из слотов, и правила у каждого свои: главное фото, галерея, инфографика, рич-контент, поля с текстом. Нейросеть закрывает часть слотов почти целиком и в остальных бесполезна. Разбираем по слотам, с цифрами площадки и промптами.
Какие требования площадки предъявляют к фото?
Минимум, ниже которого карточку не примут, площадка публикует сама. У Wildberries это разрешение 700×900 пикселей, форматы JPG, PNG и WEBP, качество сжатия не ниже 65% и до 30 фотографий в одной карточке.
| Параметр | Требование Wildberries | Что это значит для генерации |
|---|---|---|
| Минимальное разрешение | 700×900 пикселей | Просить у модели 2K, а не 1K |
| Форматы | JPG, PNG, WEBP | PNG — если нужен прозрачный фон |
| Сжатие | не ниже 65% | Не пережимать после экспорта |
| Количество фото | до 30 в карточке | Хватает на галерею плюс инфографику |
| Минимум фото | хотя бы два | Без фото товар не попадает в поиск |
Числа взяты из справки Wildberries для продавцов «Фото товаров: правила, рекомендации и частые ошибки» — страница открыта без входа в кабинет, её стоит держать в закладках. У Ozon и Яндекс Маркета свои значения, и они правятся чаще, чем обновляются подборки в поиске. Открывайте базу знаний своей площадки перед каждой большой партией.
Отдельно площадка перечисляет, чего на фото быть не должно: водяных знаков, чужих логотипов и бирок, маркетингового текста поверх товара, коллажей из нескольких товаров, товара в упаковке на главном кадре. И там же прямым текстом: «Фото неудачно сгенерировано нейросетью — изображение выглядит неестественно, а в тексте есть искажённые символы».
Из чего состоит карточка и что рисует нейросеть?
Слотов пять, и генерация закрывает три из них. Остальные два — работа человека и склада.

Главное фото и галерея — обработка реального снимка: вырезали товар, поставили сцену, вычистили шум. Инфографику модель рисует с нуля по макету, а рич-контент собирает из тех же изображений в последовательность экранов. А вот характеристики и описание модель только черновит: цифры туда вносит селлер. Пятый слот, видео, нейросети пока даётся хуже всего в предметке: товар «плывёт» между кадрами.
Как собрать главное фото товара?
В три прохода: отделить предмет от фона, подставить сцену, поднять резкость. Одним запросом это не делается — каждый проход решает свою задачу и ошибается по-своему.
Первый проход — удаление фона с фото. На выходе PNG с альфа-каналом, товар без окружения. Это не генерация: контур считает сегментатор, форма предмета остаётся ровно той, что была на снимке. Для карточки это принципиально — покупатель должен получить тот же предмет.
Второй — замена фона на новый. Здесь генерация уже работает: белая циклорама, деревянный стол, кухонная столешница. Формулируйте сцену через материал и свет, а не через настроение: «светло-серый бетон, мягкий рассеянный свет слева, мягкая тень под предметом» отрабатывает лучше, чем «стильный минималистичный фон».
Третий — улучшение качества снимка, если исходник снят телефоном при плохом свете. Порядок менять не стоит: если сначала поднять резкость, сегментатор потом цепляется за усиленный шум по контуру и оставляет рваный край.
Почему нейросеть коверкает текст на инфографике?
Потому что большинство моделей рисует буквы как узор, а не как текст. Это отдельная способность, и она появилась в моделях изображений только в последних поколениях.
В документации Gemini API «продвинутый рендеринг текста» вынесен в список возможностей отдельной строкой: модель делает читаемые подписи для инфографики, меню и диаграмм. Google в анонсе Nano Banana Pro называет gemini-3-pro-image своей лучшей моделью для корректно отрисованного текста прямо в изображении — от короткой строки до целого абзаца, с выводом в 2K и 4K. Предыдущее поколение gemini-2.5-flash-image на подписях длиннее пары слов всё ещё ломает символы.
Практический вывод: плашки с цифрами и составом рисуйте моделью, которая заявляет рендер текста, а всё остальное можно делать чем угодно. И проверяйте каждую надпись глазами — площадка отдельным пунктом заворачивает искажённые символы в тексте.
Какое соотношение сторон просить у модели?
Вертикальное 3:4 — оно попадает в пропорции карточки на всех крупных площадках и с запасом перекрывает минимум 700×900.

Документация Gemini API перечисляет доступные соотношения явно: 1:1, 3:2, 2:3, 3:4, 4:3, 4:5, 5:4, 9:16, 16:9, 21:9. Разрешения — 512 пикселей, 1K, 2K и 4K, причём облегчённая модель умеет только 1K. Берите 3:4 в 2K: получите картинку заведомо крупнее минимума площадки, а лишнее уберёте кадрированием без потери качества.
Если генерируете через API OpenAI, ограничения другие и их стоит знать заранее. Документация по генерации изображений задаёт рамку для gpt-image-2: максимальная сторона не больше 3840 пикселей, обе стороны кратны 16, отношение длинной стороны к короткой не больше 3:1, общее число пикселей от 655 360 до 8 294 400. И там же прямо сказано, что прозрачный фон эта модель не поддерживает — параметр background: "transparent" для неё не принимается.
Промпт под карточку: скелет и разбор
Промпт под предметку строится из пяти блоков, и порядок в нём важнее красоты формулировок.
Скелет: «[что за предмет и его материал] на [фон: цвет, фактура]. Свет: [направление и мягкость]. Ракурс: [фронтальный / три четверти / сверху]. Тень: [мягкая под предметом / отсутствует]. Кадр вертикальный 3:4, товар занимает [40–60]% высоты кадра, вокруг свободное поле. Без текста, без логотипов, без водяных знаков».
Последнюю строку не выбрасывайте. Модели любят дорисовывать на упаковку выдуманные надписи и значки, а это ровно то, что модерация вырезает. Запрет на текст в промпте снимает половину отказов на главном фото.
Готовые связки промптов под предметную съёмку и макеты лежат в галерее примеров инфографики — оттуда удобно брать заготовку и менять под свой товар.
Как удержать товар одинаковым на всех кадрах?
Референсами. Модель принимает исходные снимки товара и держит его вид от кадра к кадру, поэтому серию нужно генерировать не с нуля, а от фотографии.
Пределы описаны в документации Gemini API: gemini-3-pro-image работает с шестью изображениями объектов и пятью персонажами одновременно, а gemini-3.1-flash-lite-image принимает до 14 изображений объекта. На практике для одной карточки хватает трёх-четырёх ракурсов исходника: фронт, три четверти, деталь фактуры.
Типичная ошибка — генерировать каждый кадр отдельным запросом без референса. Тогда на пятом изображении у чайника меняется форма носика, и покупатель видит в галерее два разных товара.
Сколько стоит собрать одну карточку?
Порядок такой: обработка одного кадра обходится в десятки токенов, полный комплект на карточку — в сотни. Удаление фона стоит 30 токенов, замена фона — 90 токенов, улучшение снимка — 90 токенов, генерация картинки с нуля — 30 токенов.

Считаем комплект: пять кадров с удалением фона, три сцены, один прогон на резкость, две инфографики — около 700 токенов на карточку. Отладив промпт на первом товаре, дальше вы меняете в нём название и цвет, и стоимость партии становится предсказуемой.
Приветственного бонуса хватает, чтобы собрать первую карточку целиком до оплаты. Нужна регистрация с подтверждением почты, дальше — рубли и никакого VPN.
Что нейросети в карточке доверять нельзя
Всё, что покупатель потом сверит с товаром в руках: состав, габариты, вес, комплектацию, сроки, номера сертификатов и маркировку.
Есть и вторая граница, менее очевидная. Сгенерированный ракурс, которого у товара не существует, формально проходит по всем техническим требованиям — и всё равно вредит. Покупатель заказывает то, что увидел, получает другое и оставляет отзыв на единицу. Обзор остальных задач селлера, включая работу с этими отзывами, мы собрали в статье про нейросеть для маркетплейса.
Чек-лист перед загрузкой
Пройдите по нему до того, как отправите карточку на модерацию.
- Разрешение каждого кадра не ниже минимума площадки, вертикаль 3:4.
- Формат JPG, PNG или WEBP, файл не пережат после экспорта.
- На главном фото один товар, не в упаковке, без коллажа.
- Ни водяных знаков, ни чужих логотипов, ни бирок.
- Каждая надпись на инфографике прочитана глазами по буквам.
- Форма и цвет товара совпадают с реальным на всех кадрах.
- Характеристики и описание сверены со спецификацией поставщика.
- В карточке не меньше двух фотографий.
Источники
- Wildberries, справка для продавцов: «Фото товаров: правила, рекомендации и частые ошибки» — проверено 7 августа 2026.
- Google, документация Gemini API: Image generation — проверено 7 августа 2026.
- Google, блог компании: анонс Nano Banana Pro — проверено 7 августа 2026.
- OpenAI, документация: Image generation — проверено 7 августа 2026.
Частые вопросы
Какие требования к фото на Wildberries?+
Wildberries требует разрешение не ниже 700×900 пикселей, форматы JPG, PNG или WEBP, качество сжатия не ниже 65% и до 30 фотографий в одной карточке. На главном фото не должно быть водяных знаков, чужих логотипов, маркетингового текста, коллажей или товара в упаковке.
Как нейросеть делает главное фото?+
Главное фото собирается в три прохода: сначала удаляется фон с реального снимка, затем подставляется новая сцена с помощью генерации, и в конце улучшается качество снимка при необходимости. Каждый проход решает свою задачу, и их порядок важен для достижения наилучшего результата.
Почему нейросеть коверкает текст на инфографике?+
Большинство моделей рисует буквы как узор, а не как текст. Это отдельная способность, которая появилась только в последних поколениях моделей изображений, таких как `gemini-3-pro-image`. Важно использовать модели, заявляющие продвинутый рендеринг текста, и всегда проверять надписи глазами.
Какое соотношение сторон выбрать для карточки?+
Рекомендуется использовать вертикальное соотношение сторон 3:4. Оно подходит для всех крупных площадок и с запасом перекрывает минимальные требования к разрешению, например 700×900 пикселей. Лучше генерировать изображения в 2K, чтобы иметь запас для кадрирования без потери качества.
Попробуйте прямо сейчас
Без VPN и зарубежных карт — оплата в рублях, первый шаг за минуту.
Попробовать модели в Trackly