Kandinsky — семейство нейросетей от Sber AI, исследовательского подразделения Сбербанка. Версия 5.0 включает три специализированные модели разного масштаба.
Архитектура построена на технологии Flow Matching — более эффективной, чем классическая диффузия. Модель достигает хорошего результата за меньшее количество шагов, а значит генерирует быстрее и стабильнее. Обучена на миллиарде изображений и трехстах миллионах видеороликов, плюс миллион примеров, отобранных вручную. Весь код распространяется под лицензией MIT — можно использовать в коммерческих проектах без ограничений.
Самый простой путь — GigaChat через браузер или мобильное приложение. Регистрация по номеру телефона, никаких VPN и иностранных карт. Открываете интерфейс, пишете описание на русском — и через несколько секунд получаете картинку. Для большинства пользователей этого достаточно.
Для тех, кто хочет больше контроля, есть несколько вариантов:
Если дома стоит видеокарта уровня RTX 3090 или RTX 4090, можно запустить даже видеомодель локально. Легкая версия требует 12 ГБ видеопамяти — скромно для современных стандартов.
Интерфейс GigaChat минималистичный и понятный. Поле для промпта, выбор параметров (размер, стиль, количество итераций), кнопка генерации. Никаких запутанных меню и скрытых настроек — все на виду.
Мобильная версия работает чуть медленнее (что ожидаемо), но стабильно. Приложение весит около 150 мегабайт. Веб-версия отзывчивая даже на медленном интернете — при тестировании на мобильной сети в метро все работало без сбоев.
Hugging Face предлагает более технический интерфейс: полный контроль над параметрами, возможность задать точное количество шагов, температуру генерации и другие детали. Подойдет тем, кто хочет выжать из модели максимум.
Вся история генераций сохраняется. Можно вернуться к любой картинке спустя месяц, посмотреть, с какими параметрами она создавалась, и перегенерировать с изменениями. Для итеративной работы это очень удобно.
Из раздражающего — очереди в часы пик. С 19:00 до 23:00 по московскому времени ожидание может растянуться до десяти минут. Для бесплатного сервиса это нормально, но терпения требует. Система показывает примерное время ожидания, так что хотя бы не приходится гадать.
Генерация изображений с пониманием русского языка. Это не просто перевод промпта на английский и обратно. Kandinsky обучался на русскоязычных данных и понимает контекст, культурные реалии, специфику. Промпт «русская деревня на закате» дает именно русскую архитектуру — бревенчатые дома, наличники, березы, — а не абстрактный «village». Английские промпты тоже обрабатываются корректно, но на русском результаты стабильно точнее — примерно на 10%.
Генерация видео — главное преимущество. Профессиональная модель создает ролики до десяти секунд в HD при 24 кадрах в секунду. Движения выглядят естественно, артефактов немного, камера перемещается плавно, сцена остается консистентной от начала до конца. Для открытой модели — впечатляющий результат.
Видео можно создавать несколькими способами: генерация с нуля по текстовому описанию, преобразование статичной картинки в ролик с движением, генерация в стиле референсного изображения, точное управление движением камеры, редактирование отдельных областей видео через маски.
Открытый исходный код (лицензия MIT). Код можно скачать, изучить, модифицировать, встроить в свой продукт. Для разработчиков это принципиальный момент: никакой зависимости от стороннего API, никаких внезапных изменений условий. Лицензия MIT — одна из самых свободных, она разрешает коммерческое использование без оговорок.
Локальный запуск. Все можно развернуть на своем оборудовании. Данные не покидают ваш компьютер, промпты не отправляются на чужие серверы. Для компаний, работающих с конфиденциальной информацией, это существенный плюс.
Негативные промпты. Как и в Stable Diffusion, можно указать, чего на картинке быть не должно: «размытое, плохая анатомия, лишние пальцы, деформированные руки». Для видео негативные промпты особенно важны — по тестам они улучшают качество на 20–30%.
Промо-видео для кафе или ресторана. Обычно такой ролик стоит от пятисот до двух тысяч долларов у видеографа. С Kandinsky можно сгенерировать короткое видео для сторис за несколько минут. Промпт: «Чашка горячего кофе на деревянном столе рядом с круассаном, солнечный свет через окно, французское кафе, утренняя атмосфера, теплые тона». Результат — шесть-семь секунд видео, которое останется только наложить музыку в любом редакторе. Стоимость: ноль рублей.
Иллюстрации для технической документации. Компания готовит руководство для клиентов, нужны схемы и визуалы. Рисовать вручную — долго, нанимать дизайнера — дорого. Промпт: «Диаграмма архитектуры микросервисов, иконки серверов и баз данных, стрелки потока данных, синий и серый цвета, минимализм, белый фон». Результат используется как базовый слой, который потом дорабатывается в графическом редакторе.
Раскадровки для рекламных роликов. Режиссер планирует съемку, нужно показать клиенту, как будет выглядеть каждая сцена. За пятнадцать минут Kandinsky генерирует варианты всех ключевых кадров. Это ускоряет процесс согласования на неделю. Финальный ролик снимают на камеру, но на этапе планирования нейросеть экономит массу времени.
Контент для русскоязычной аудитории. YouTube-канал или Telegram-канал хочет делать обложки и превью, заточенные именно под российскую аудиторию. Kandinsky генерирует виды русских городов, привычную архитектуру, предметы культуры, текст на кириллице — и результат выглядит органично, а не как переведенный иностранный шаблон.
Исследование художественных стилей. Дизайнер работает над портфолио и хочет попробовать разные направления: масло, акварель, пиксель-арт, 3D, пленочная фотография, минимализм. Вместо часов ручной работы — десятки вариаций за минуты. Kandinsky отлично справляется с имитацией стилей, особенно если указать их в промпте явно.
Генерация контента для маркетплейсов. Продавец на Ozon или Wildberries готовит карточки товаров. Нужны фоновые изображения, lifestyle-фото с товаром в интерьере. Kandinsky генерирует фоны и сцены, в которые потом монтируется реальная фотография товара.
Пишите на русском — модель обучена на большом массиве русскоязычных данных и лучше понимает именно русский. Английский работает, но примерно на 10% менее точно.
Описывайте сцену конкретно. Не «красивая природа», а «сосновый лес на закате, красное солнце низко над горизонтом, туман между стволами, желтые осенние листья». Чем больше деталей, тем точнее результат.
Указывайте стиль явно, лучше в конце промпта: «фотография», «масло на холсте», «цифровое искусство», «3D-рендер», «фотография на пленку Kodak», «акварель».
Прописывайте освещение: «мягкий боковой свет», «контровой свет от окна», «золотой час», «неоновое свечение ночного города». Освещение кардинально меняет настроение.
Для видео избегайте слишком длинных описаний. Оптимально — 15–20 слов. Для картинок можно и 30–50. В длинных промптах модель начинает путаться.
Управляйте камерой явно: «панорамирование слева направо», «медленный наезд на 30%», «статичная камера», «плавное движение вверх». Без этих указаний камера будет стоять на месте или двигаться хаотично.
Используйте негативные промпты. «Руки с лишними пальцами, размытое, деформированное, плохая анатомия» — стандартный набор, который стоит добавлять всегда. Для видео это особенно критично.
Структурируйте промпт знаками препинания. «Деревянный стол, кофейная чашка, утренний свет. Фотография. Теплые тона, уют. Боке на фоне» — работает лучше, чем сплошной поток слов.
|
Функция |
Стоимость |
Комментарий |
|
Генерация изображений (GigaChat) |
Бесплатно |
Без ограничений |
|
Генерация видео (легкая модель) |
Бесплатно |
Суточный лимит |
|
Генерация видео (профессиональная модель) |
Бесплатно |
Суточный лимит |
|
Локальный запуск |
Бесплатно |
Лицензия MIT, нужна видеокарта |
|
Коммерческое использование результатов |
Бесплатно |
Разрешено лицензией MIT |
|
API для бизнеса |
По договору |
Условия по запросу |
Kandinsky — один из немногих серьезных генераторов, который полностью бесплатен. Нет подписок, нет токенов, нет скрытых платежей. Единственная статья расходов — видеокарта, если вы хотите запускать модели локально.
|
Параметр |
Kandinsky 5.0 |
Midjourney |
DALL-E |
Stable Diffusion |
|
Качество изображений |
Хорошее |
Отличное |
Хорошее |
Хорошее |
|
Генерация видео |
Да (до 10 сек, HD) |
Нет |
Нет |
Нет |
|
Понимание русского |
Отличное |
Среднее |
Среднее |
Среднее |
|
Открытый исходный код |
Да (MIT) |
Нет |
Нет |
Частично |
|
Стоимость |
Бесплатно |
$10–120/мес |
По токенам |
Бесплатно (локально) |
|
Доступ из России |
Без ограничений |
Нужен VPN + иностранная карта |
Нужен VPN |
VPN для загрузки моделей |
|
Коммерческое использование |
Разрешено |
Ограничено на бесплатном плане |
Разрешено |
Разрешено |
|
Скорость генерации |
Быстрая |
Средняя |
Быстрая |
Зависит от GPU |
Если коротко: по художественному качеству картинок Midjourney впереди. По удобству интеграции — DALL-E (встроен в ChatGPT). По свободе и контролю — Stable Diffusion. Kandinsky выигрывает в трех вещах: бесплатная генерация видео, лучшее понимание русского языка и беспроблемный доступ из России.
Текст на картинках. Kandinsky часто допускает ошибки в надписях — по тестам примерно в 30% случаев буквы искажаются или путаются. Особенно проблемно с латиницей. Если нужен текст — лучше добавить его потом в графическом редакторе.
Короткое видео. Максимум десять секунд. Для сторис и коротких роликов этого хватает, но для полноценного контента придется склеивать фрагменты вручную.
Художественное качество ниже топовых конкурентов. Kandinsky хорош, но Midjourney в художественных задачах (портреты, арт, сложные композиции) пока выдает результат на уровень выше.
Очереди в часы пик. Бесплатный сервис — бесплатные ограничения. В вечернее время ожидание может достигать десяти минут. Решение — локальный запуск на своей видеокарте.
Маленькое международное сообщество. Подписчиков на Reddit и в англоязычных форумах в разы меньше, чем у Stable Diffusion. Меньше готовых примеров, туториалов и сторонних инструментов.
Консистентность лиц в видео. Как и у конкурентов, лицо персонажа может слегка меняться между кадрами. Проблема не уникальна для Kandinsky, но она есть.
Нет встроенного звука. Видео генерируется без аудиодорожки. Музыку и озвучку нужно добавлять отдельно.
Это, пожалуй, главный козырь Kandinsky для российских пользователей. Никакого VPN. Никаких иностранных карт. Никаких сложностей с оплатой — потому что платить не за что. Сервис работает через GigaChat, мобильное приложение, Telegram-бот. Серверы в России, задержки минимальные.
Для сравнения: Midjourney требует VPN и иностранную карту для оплаты. DALL-E доступен только через ChatGPT, который тоже требует VPN. Stable Diffusion работает локально, но для скачивания моделей с Hugging Face иногда нужен VPN. Kandinsky — единственный из серьезных генераторов, где все работает напрямую.
Для компаний, которым важна технологическая независимость от западных платформ, это принципиальный аргумент. Если вы создаете контент для русскоязычной аудитории и хотите избежать рисков, связанных с санкциями и блокировками, Kandinsky — логичный выбор.
Данные обрабатываются по российскому законодательству. Если используете GigaChat, промпты могут сохраняться для улучшения модели — это стандартная практика, и ее стоит учитывать при работе с конфиденциальной информацией.
Если запускаете модель локально на своей видеокарте, данные не покидают ваш компьютер. Исходный код открыт и доступен для аудита — можно убедиться, что в модели нет скрытой телеметрии или отправки данных на сторонние серверы.
Подходит:
Не подходит:
Начните с GigaChat — не нужно ничего устанавливать. Откройте браузер, напишите промпт на русском, посмотрите на результат. Первые впечатления получите за пять минут.
Пишите промпты на русском, не на английском. Kandinsky обучался на большом массиве русскоязычных данных и лучше понимает именно русский. Описание «осенний парк в Петербурге, мокрые листья на тротуаре, свет фонарей» даст более точный результат, чем его английский аналог.
Сначала попробуйте генерацию изображений — это быстрее и проще, чем видео. Разберитесь с промптами, поймите, как модель реагирует на разные описания. Потом переходите к видео.
Не ждите идеала с первого раза. Генерируйте три-пять вариантов, выбирайте лучший. Если ни один не подошел — переформулируйте промпт. Добавьте деталей, уточните стиль, укажите освещение.
Обязательно используйте негативные промпты, особенно для видео. Базовый набор: «размытое, плохая анатомия, лишние пальцы, деформированные руки, низкое качество».
Если дома стоит видеокарта с 12+ ГБ памяти, попробуйте локальный запуск. Генерация без очередей — ощутимое преимущество, особенно при работе с видео.
Загляните на Hugging Face — там есть примеры промптов и результатов от других пользователей. Это помогает понять, что модель умеет и как лучше формулировать запросы.
Kandinsky 5.0 — не Midjourney-киллер. По художественному качеству картинок он пока уступает лидерам рынка. Но он и не пытается быть копией — у него своя ниша, и в этой нише он сильнее всех.
Три вещи, которые Kandinsky делает лучше конкурентов: понимание русского языка, бесплатная генерация видео и беспроблемный доступ из России. Если хотя бы один из этих пунктов для вас важен, Kandinsky стоит попробовать.
Для создателей контента на русскоязычную аудиторию это, пожалуй, самый практичный выбор. Не нужно возиться с VPN, не нужно платить за подписки, не нужно переводить промпты на английский. Открываете GigaChat, пишете на русском, получаете результат. Если качества не хватает — всегда можно доработать в графическом редакторе или переключиться на Midjourney для особо важных задач.
Для разработчиков открытый код под лицензией MIT — серьезный аргумент. Можно встроить генерацию в свой продукт, развернуть на собственных серверах, модифицировать под свои нужды. Никакой зависимости от чужого API, никаких неожиданных изменений условий.
Рекомендация простая: попробуйте. Это бесплатно, не требует установки, занимает пять минут. Если результат устроит — отлично, вы нашли бесплатный инструмент. Если нет — ничего не потеряли