Grok-imagine
Характеристики модели
Разработчик: xAi
Языковая модель: Grok
Название от разработчика: grok-imagine-image
Дата выхода: январь, 2026
Тип модели: для генерации изображений
Контекст: 1К
Статус: активная
Доступно в API: Да
Модальности и цены
На ввод (в запросе пользователя) модель может принимать:
На выводе модель выдает:
Цены указаны за 1000 токенов / 1 шт. изображения (зависит от модели). В среднем 2000 токенов требуется для генерации 1 изображения.
Поддержка файлов
Поддержка функций
Размышление: нет
Веб-поиск: нет
Генерация изображений
Размеры:
Соотношения сторон:
Качество:
Описание модели
Grok Imagine — семейство генеративных визуальных моделей от компании xAI, предназначенных для создания и редактирования изображений и видео. Линейка входит в экосистему Grok и используется для визуального контента, творческих задач, обработки изображений и создания видеороликов.
Grok Imagine поддерживает генерацию изображений по текстовому описанию, работу с исходными изображениями и редактирование визуального контента. В API xAI доступна отдельная модель grok-imagine-image, которая принимает текст и изображения и генерирует изображения.
В 2026 году xAI продолжила развитие линейки. В августе была представлена Imagine Image 2.0 — новая версия модели для генерации и редактирования изображений, ориентированная на точное следование инструкциям, работу с типографикой, композицией и сохранение элементов исходного изображения при последовательных генерациях и редактировании. В API она доступна как grok-imagine-image-2.0.
Отдельное направление Grok Imagine связано с видео. Модели линейки позволяют создавать видео из текста или изображения, изменять существующие сцены, добавлять и удалять объекты, управлять движением и генерировать звук. В июне 2026 года xAI выпустила Grok Imagine Video 1.5, которая получила улучшения в качестве движения, физике, звуке и синхронизации речи.
Ключевые возможности
Генерация изображений
Grok Imagine позволяет создавать изображения по текстовым описаниям. Пользователь может задавать содержание сцены, визуальный стиль, композицию, объекты, освещение и другие параметры.
Редактирование изображений
Модель может работать с исходными изображениями и изменять их в соответствии с текстовыми инструкциями. Это позволяет добавлять, удалять или изменять элементы сцены, а также создавать новые варианты существующего изображения.
Точная работа с текстом и композицией
Актуальная Imagine Image 2.0 получила улучшенное следование инструкциям и более точную работу с типографикой и композицией. xAI отдельно отмечает способность модели планировать расположение текста и элементов дизайна, что особенно полезно при создании плакатов, рекламных материалов и других изображений с большим количеством текста.
Фотореалистичные изображения
Grok Imagine подходит для создания реалистичных сцен, персонажей, предметных фотографий и рекламных визуалов. xAI также позиционирует Quality Mode как режим с повышенным уровнем реализма, детализации и контроля над результатом.
Генерация видео
Отдельные модели Grok Imagine Video позволяют создавать видео из текста или изображения, а также редактировать существующие сцены. Поддерживаются задачи изменения объектов, стилизации, управления движением и создания звукового сопровождения.
Работа с референсами
Использование исходного изображения позволяет задавать основу для последующей генерации или редактирования. Это удобно для сохранения внешнего вида персонажей, объектов, композиций и визуального стиля между несколькими итерациями.
Для каких задач подходит?
- Реклама: создание рекламных изображений, баннеров, промоматериалов и визуальных концепций.
- Дизайн: разработка макетов, постеров, обложек и графических концепций.
- Социальные сети: создание изображений, мемов, иллюстраций и другого визуального контента.
- Предметная визуализация: создание реалистичных изображений товаров и рекламных сцен.
- Концепт-арт: разработка персонажей, окружения и визуальных идей.
- Редактирование фотографий: изменение объектов, фона, стиля и других элементов изображения.
- Создание видео: анимация изображений и генерация видеосцен с помощью Grok Imagine Video.
- Прототипирование: быстрое создание и сравнение визуальных концепций.
Сравнение с конкурентами
| Параметр | Grok Imagine | DALL-E 3 | Midjourney v6+ |
|---|---|---|---|
| Работа с текстом | Превосходная | Хорошая | Средняя |
| Фотореализм | Очень высокий | Высокий | Очень высокий |
| Цензура | Умеренная (позволяет сатиру) | Строгая | Строгая |
| Доступность | Встроена в X / API | ЧатGPT / API | Discord / Web |
| Скорость | Высокая | Средняя | Низкая (Fast mode) |
Сравнение качества генерации
Лучший способ оценить модель — увидеть результат. Ниже приведены примеры генерации по промпту:
«Киберпанк-кошка с неоновыми усиками и механическим хвостом сидит на фоне ночного города с летающими автомобилями, цифровой арт»
DALL-E 3:

Gemini 2.5 Flash Image:

Gemini 3.1 Flash Image:

Gemini 3.0 Pro Image:

Grok Imagine:

Grok Imagine Pro:

Технические характеристики
- Базовая архитектура: FLUX.1 (от партнеров Black Forest Labs).
- Разрешение: Поддержка различных соотношений сторон (от 16:9 до 9:16) с высокой детализацией.
- Понимание промта: Отличное понимание естественного языка, даже коротких и абстрактных запросов.
- Типографика: Улучшенные алгоритмы для генерации шрифтов и логотипов.