Перейти к содержимому

Что умеет Stable Diffusion

Генерация по тексту — только первый режим. Остальные превращают модель из генератора случайных картинок в инструмент, которым можно доводить кадр до нужного.

Из текста в изображение

Базовый режим: вы описываете кадр, модель начинает со случайного шума и убирает его шаг за шагом, пока не проступит описанное. Один и тот же промпт с разным начальным шумом даёт разные картинки — поэтому генерируют обычно пачкой и выбирают.

Из изображения в изображение

На вход подаётся картинка, и модель перерисовывает её по вашему описанию. Степень вмешательства регулируется: при слабом влиянии сохраняется композиция и меняется только стилистика, при сильном от исходника остаётся общий силуэт. Так превращают набросок в готовую иллюстрацию или переводят фотографию в живопись.

Фотореализм

На сложной сцене со светом и фактурой линейка 3.5 держится уверенно: кожа, пыль в воздухе, малая глубина резкости — всё это задаётся словами в промпте.

Stable Diffusion — фотореалистичный портрет, сгенерированный моделью

Правка готового кадра

Эти режимы работают с уже существующим изображением — своим или сгенерированным ранее.

Inpaint — дорисовать выделенное

Вы закрашиваете кистью область и описываете, что там должно оказаться. Так убирают лишний предмет, меняют одежду, чинят неудачно вышедшую руку. Остальной кадр остаётся нетронутым.

Outpaint — расширить кадр

Модель достраивает изображение за его границами, продолжая сцену. Вертикальное фото превращается в горизонтальное, а тесная композиция получает воздух по краям.

Удаление фона и объектов

Фон отделяется от предмета, отдельный объект стирается вместе с тенью, а на его месте достраивается то, что было позади. В облачном API это отдельные операции, локально — те же inpaint-инструменты.

Увеличение

Апскейл поднимает разрешение, дорисовывая детали, которых в оригинале не было. В API три режима: быстрый, консервативный без переосмысления кадра и творческий с дорисовкой до 4K.

ControlNet: управление композицией

Самое важное расширение экосистемы. Обычная генерация — это лотерея: вы описываете кадр словами и надеетесь на удачную компоновку. ControlNet задаёт модели каркас и заставляет держаться его.

В качестве каркаса подаётся вспомогательное изображение: карта позы человека, контурный набросок, карта глубины сцены, границы объектов. Модель наполняет эту схему содержанием по вашему промпту, но не отступает от заданной геометрии.

Практический смысл в том, что результат становится воспроизводимым. Нарисовали от руки расположение предметов — получили ровно его. Сняли позу с фотографии — получили персонажа в этой позе. В облачном API те же задачи решают режимы Structure, Sketch и Style Guide.

Inpaint: выделенная область заменяется тем, что вы опишете.

Stable Diffusion — мелкая фактура после увеличения кадра

Апскейл: детали дорисовываются, а не растягиваются.

Перенос стиля

Отдельный режим, где на вход подаётся образец стилистики, а не композиции: модель забирает из него палитру, фактуру и манеру, применяя к вашему сюжету. Локально ту же задачу чаще решают через LoRA — небольшие дообученные надстройки, которые подключаются к базовой модели.

Чего модель не делает

Генерация видео в облачном API Stability отключена с 24 июля 2025 года; модель Stable Video Diffusion при этом осталась доступной для самостоятельного запуска — на своей видеокарте, по Community License.

Ещё модель не редактирует изображение «по команде» так, как это делает человек-ретушёр: она не понимает «сделай красивее». Любая правка — это либо перегенерация, либо точечная работа выделенной областью.