Inpaint — дорисовать выделенное
Вы закрашиваете кистью область и описываете, что там должно оказаться. Так убирают лишний предмет, меняют одежду, чинят неудачно вышедшую руку. Остальной кадр остаётся нетронутым.
Генерация по тексту — только первый режим. Остальные превращают модель из генератора случайных картинок в инструмент, которым можно доводить кадр до нужного.
Базовый режим: вы описываете кадр, модель начинает со случайного шума и убирает его шаг за шагом, пока не проступит описанное. Один и тот же промпт с разным начальным шумом даёт разные картинки — поэтому генерируют обычно пачкой и выбирают.
На вход подаётся картинка, и модель перерисовывает её по вашему описанию. Степень вмешательства регулируется: при слабом влиянии сохраняется композиция и меняется только стилистика, при сильном от исходника остаётся общий силуэт. Так превращают набросок в готовую иллюстрацию или переводят фотографию в живопись.
На сложной сцене со светом и фактурой линейка 3.5 держится уверенно: кожа, пыль в воздухе, малая глубина резкости — всё это задаётся словами в промпте.

Эти режимы работают с уже существующим изображением — своим или сгенерированным ранее.
Вы закрашиваете кистью область и описываете, что там должно оказаться. Так убирают лишний предмет, меняют одежду, чинят неудачно вышедшую руку. Остальной кадр остаётся нетронутым.
Модель достраивает изображение за его границами, продолжая сцену. Вертикальное фото превращается в горизонтальное, а тесная композиция получает воздух по краям.
Фон отделяется от предмета, отдельный объект стирается вместе с тенью, а на его месте достраивается то, что было позади. В облачном API это отдельные операции, локально — те же inpaint-инструменты.
Апскейл поднимает разрешение, дорисовывая детали, которых в оригинале не было. В API три режима: быстрый, консервативный без переосмысления кадра и творческий с дорисовкой до 4K.
Самое важное расширение экосистемы. Обычная генерация — это лотерея: вы описываете кадр словами и надеетесь на удачную компоновку. ControlNet задаёт модели каркас и заставляет держаться его.
В качестве каркаса подаётся вспомогательное изображение: карта позы человека, контурный набросок, карта глубины сцены, границы объектов. Модель наполняет эту схему содержанием по вашему промпту, но не отступает от заданной геометрии.
Практический смысл в том, что результат становится воспроизводимым. Нарисовали от руки расположение предметов — получили ровно его. Сняли позу с фотографии — получили персонажа в этой позе. В облачном API те же задачи решают режимы Structure, Sketch и Style Guide.
Inpaint: выделенная область заменяется тем, что вы опишете.

Апскейл: детали дорисовываются, а не растягиваются.
Отдельный режим, где на вход подаётся образец стилистики, а не композиции: модель забирает из него палитру, фактуру и манеру, применяя к вашему сюжету. Локально ту же задачу чаще решают через LoRA — небольшие дообученные надстройки, которые подключаются к базовой модели.
Генерация видео в облачном API Stability отключена с 24 июля 2025 года; модель Stable Video Diffusion при этом осталась доступной для самостоятельного запуска — на своей видеокарте, по Community License.
Ещё модель не редактирует изображение «по команде» так, как это делает человек-ретушёр: она не понимает «сделай красивее». Любая правка — это либо перегенерация, либо точечная работа выделенной областью.