Перейти к содержимому

Промпты для Stable Diffusion

Модель не читает предложения так, как человек. Она разбирает описание на понятия и взвешивает их — отсюда и все приёмы, из которых состоит хороший промпт.

Писать нужно по-английски

Модель обучалась на англоязычных описаниях изображений, поэтому русский текст она разбирает плохо: получите что-то отдалённо похожее либо вовсе мимо. Рабочий порядок — сформулировать мысль по-русски и перевести, пусть даже машинным переводчиком. Интерфейс при этом можно русифицировать, на понимание промпта это не влияет.

Второе следствие: промпт — это не связная фраза, а перечисление. «Портрет пожилого гончара в мастерской, мягкий свет из окна, 85 мм, малая глубина резкости» работает лучше, чем художественно построенное предложение.

Структура, которая обычно работает

  1. Субъект — кто или что в кадре.
  2. Действие и окружение — что происходит и где.
  3. Свет и настроение — мягкий рассеянный, контровой, золотой час.
  4. Оптика и ракурс — крупный план, 85 мм, вид сверху.
  5. Стиль — фотореализм, масляная живопись, плоская векторная иллюстрация.

Порядок имеет значение: то, что стоит ближе к началу, модель считает важнее.

Синтаксис: веса и скобки

Отдельным понятиям можно поднять или снизить значимость. Запись (red scarf:1.3) усиливает влияние, (background:0.7) ослабляет. Единица — нейтральное значение.

Разумный диапазон — примерно от 0,6 до 1,4. Если задрать вес сильно выше, модель начинает ломать композицию: деталь вылезает на весь кадр и тянет за собой артефакты.

Негативный промпт

Отдельное поле, куда перечисляется то, чего в кадре быть не должно. Работает оно не как запрет, а как отталкивание: модель уводит результат от перечисленных понятий.

Универсального «идеального» негативного промпта не существует, и длинные списки на сорок слов чаще вредят, чем помогают: они уводят картинку в сторону. Практичнее держать короткий набор под конкретную проблему — например, убрать искажённые пальцы или лишние надписи.

Параметры, которые меняют результат сильнее слов

Шаги (steps)

Сколько раз модель убирает шум. Для обычных моделей рабочий диапазон 20–35: выше качество почти не растёт, а время увеличивается линейно. Turbo-версии рассчитаны на 4 шага, и накручивать им больше бессмысленно.

CFG Scale

Насколько жёстко держаться промпта. Около 7 — сбалансированно. Ниже модель фантазирует свободнее, выше — буквальнее следует тексту, но картинка становится жёсткой и перенасыщенной.

Seed

Число, задающее начальный шум. Одинаковый seed при тех же параметрах даёт тот же кадр. Это главный инструмент отладки: зафиксировали seed — и меняете промпт по одному слову, видя эффект каждого.

Примеры

Три промпта разного типа — их можно вставить как есть и дальше править под себя.

Фотореалистичный портрет

photorealistic portrait of an elderly ceramicist in a sunlit workshop, clay dust in the air, soft window light, 85mm lens, shallow depth of field, natural skin texture

Плоская иллюстрация

flat vector illustration of a snowy village at dusk, limited palette, geometric shapes, clean edges, poster style

Предметная съёмка

studio product shot of a matte ceramic cup on seamless backdrop, soft box lighting, crisp single shadow, commercial photography, 50mm

Stable Diffusion — плоская векторная иллюстрация по промпту
Stable Diffusion — предметная съёмка по промпту

Кадр с первого раза почти никогда не получается. Рабочий цикл такой: сгенерировали четыре варианта, выбрали ближайший, зафиксировали его seed и дальше правите промпт по одному понятию за раз. Так видно, что именно даёт эффект, а что вы дописали зря.

Текст в кадре

Надписи — слабое место всех генераторов, но линейка 3.5 справляется с ними заметно лучше предыдущих. Помогает короткая фраза в кавычках и явное указание, что надпись должна быть читаемой. Длинный текст всё равно будет рассыпаться.