Что такое Dall-E 3 и чем она отличается от предыдущих версий
Dall-E 3 — это третье поколение генеративной нейросети от компании OpenAI, способной создавать изображения по текстовому описанию. Первая версия, представленная в 2021 году, была скорее экспериментальной и генерировала картинки низкого качества, которые, тем не менее, стали вирусными в интернете. В 2022 году вышла Dall-E 2, которая уже поддерживала запросы на русском языке и давала более качественные результаты, но доступ к ней был ограничен через список ожидания. Осенью 2023 года OpenAI представила Dall-E 3, которая стала доступна широкой аудитории через Bing Image Creator и по платной подписке в ChatGPT.
Главное отличие новой версии — встроенный языковой помощник. Если в Midjourney или Stable Diffusion пользователю нужно самостоятельно изучать синтаксис промптов и писать запросы на английском по специальной формуле, то Dall-E 3 понимает естественную речь. Вы пишете запрос на русском или другом языке, а нейросеть сама «докручивает» идею, переписывая её в более детальный промпт для генерации. Это делает работу с нейросетью доступной для новичков, которые не хотят тратить время на изучение промпт-инжиниринга.
Ещё одно важное нововведение — интеграция с GPT-4 в ChatGPT. В чате можно одновременно общаться с языковой моделью и генерировать изображения, уточняя запросы в диалоге. В Bing Image Creator используется неизвестная версия GPT, которая также переписывает запросы, но повлиять на этот процесс нельзя.
Как работает Dall-E 3: три нейросети внутри одной
Процесс генерации изображения в Dall-E 3 состоит из нескольких этапов, в которых участвуют три нейросети. Первая — CLIP (Contrastive Language–Image Pre-training) — анализирует текстовый запрос и преобразует его в набор числовых векторов. Эти векторы показывают, насколько близки между собой описанные пользователем понятия. Затем CLIP создаёт таблицу-черновик будущего изображения.
Вторая нейросеть — GLIDE — берёт эту таблицу и через диффузную модель превращает её в изображение. Сначала появляется серый квадрат из пиксельного шума, из которого поэтапно убирается шум, пока не вырисовывается картинка с нужным содержимым. Третья нейросеть отвечает за увеличение разрешения — она улучшает качество изображения в 16 раз.
В Dall-E 3 этот процесс дополнен работой языковой модели. Когда пользователь вводит запрос, GPT-4 (или другая версия GPT в Bing) переписывает его согласно встроенной инструкции, делая промпт более подробным и понятным для генеративной части. Именно поэтому один и тот же запрос может давать совершенно разные результаты — нейросеть каждый раз интерпретирует его по-своему.
Как получить доступ к Dall-E 3: два основных способа
На данный момент существует два легальных способа воспользоваться Dall-E 3. Первый — бесплатный — через Bing Image Creator. Для этого нужно перейти на страницу bing.com/images/create и войти в учётную запись Microsoft. Если у вас Windows 8, 10 или 11, такая запись уже есть. Пользователям других операционных систем потребуется зарегистрироваться. Интерфейс Bing Image Creator очень простой: строка для ввода запроса, кнопки «Создать» и «Удиви меня», а также галерея с работами других пользователей. В день даётся 25 «ускорений» — быстрых генераций. Когда они заканчиваются, картинки создаются медленнее. Докупить ускорения нельзя.
Второй способ — платная подписка ChatGPT Plus за 20 долларов в месяц. Для регистрации потребуется зарубежный номер телефона и международная карта. В ChatGPT Plus доступ к Dall-E 3 добавляется постепенно, и не у всех пользователей он появляется сразу. В чате можно одновременно обращаться к GPT-4 и Dall-E 3: если задать общий вопрос, нейросеть ответит текстом, а если попросить нарисовать — начнётся генерация. По умолчанию создаются четыре квадратных изображения 1024×1024 пикселя, но в запросе можно указать горизонтальный (1792×1024) или вертикальный (1024×1792) формат.
Важно отметить, что доступа к API Dall-E 3 пока нет — OpenAI обещала предоставить его позже. Это значит, что встраивать нейросеть в сторонние приложения пока нельзя.
Какие изображения умеет создавать Dall-E 3: сильные стороны
Dall-E 3 отлично справляется с креативными идеями и сложными запросами. Нейросеть не пропускает детали и прорабатывает мелкие элементы, что позволяет генерировать практически любую концепцию. Она хорошо знает мемы и поп-культуру, хотя из-за фильтров не всегда может создать популярных персонажей. При этом фильтр иногда не срабатывает — например, удаётся сгенерировать логотипы, защищённые авторским правом.
Ещё одна сильная сторона — генерация текста. У Dall-E 3 получаются красивые комиксы, графики и схемы, чего сложно добиться в других нейросетях. Правда, текст часто содержит лишние символы или ошибки, и нейросеть генерирует только надписи на английском. Но если нужно создать пару слов на логотипе, результат будет хорошим.
Нейросеть умеет стилизовать изображения под разных художников, хотя имена мастеров, живших в последние сто лет, использовать нельзя — запрос будет заблокирован из-за авторских прав. Однако если описать стиль словами без упоминания имени, генерация сработает. Также нейросеть может имитировать разные медиумы: фото, картину, кадр из фильма, иллюстрацию. Если не указать медиум, результаты будут смешанными.
Dall-E 3 поддерживает русский язык и понимает естественную речь. Запросы можно писать так же, как вы разговариваете с людьми, и вносить правки, если результат не устраивает. Например, сработает как запрос «нарисуй мне фиолетового анимешного кота», так и «фиолетовый кот, аниме».
Ограничения и слабые места Dall-E 3
Несмотря на впечатляющие возможности, у Dall-E 3 есть ряд ограничений. Главное из них — строгая цензура. Нейросеть отказывается генерировать сцены насилия, ненависти, NSFW-контент, а также изображения знаменитостей и общественных деятелей. В первые дни после запуска пользователи находили способы обходить фильтры, но затем цензуру усилили. Теперь не получится сгенерировать даже удар молотком или гору человеческих костей. Многие жалуются, что алгоритму сделали «лоботомию».
Второе ограничение — защита авторских прав. Dall-E 3 не станет генерировать картинки в стиле художников, живших в последние сто лет, а также кадры из фильмов или изображения с узнаваемыми персонажами. Если художник заметит, что нейросеть обучалась на его работах, он может обратиться к OpenAI и попросить заблокировать генерацию таких изображений.
Третье — качество фотореализма. Dall-E 3 пока уступает Midjourney и Stable Diffusion в создании реалистичных фотографий. Линии на снимках получаются слишком плавными, сразу видно, что изображение сгенерировано нейросетью. Особенно заметны проблемы с анатомией: у людей могут быть неестественные зубы, слишком резкие границы волос, а на часах не хватает стрелок.
Четвёртое — технические ограничения. Нейросеть не умеет создавать бесшовные паттерны, которые можно бесконечно повторять. Также она не всегда правильно понимает запросы с отрицаниями («без», «кроме») и может присваивать неправильные векторы объектам, из-за чего они располагаются нелогично.
Сравнение Dall-E 3 с Midjourney и Stable Diffusion
Dall-E 3, Midjourney и Stable Diffusion — три главные нейросети для генерации изображений, и у каждой есть свои особенности. Midjourney считается лучшей по качеству фотореализма и художественной ценности, но требует изучения синтаксиса промптов на английском, а доступ к ней осуществляется через Discord. Stable Diffusion — открытая модель, которую можно запустить на своём компьютере, но для этого нужны мощное железо и навыки программирования. Кроме того, Stable Diffusion требует точных промптов на английском.
Dall-E 3 выигрывает в доступности и простоте. Она бесплатна (через Bing Image Creator), не требует мощного компьютера и понимает естественную речь на русском языке. Нейросеть сама «докручивает» запросы, что удобно для новичков. Однако в фотореализме она уступает Midjourney, а в гибкости настройки — Stable Diffusion.
Ещё одно отличие — количество генерируемых изображений. Dall-E 3 создаёт четыре картинки по одному запросу, Midjourney — четыре, но с возможностью апскейла, а Stable Diffusion — любое количество в зависимости от настроек. Также Dall-E 3 не позволяет менять соотношение сторон в бесплатной версии (только квадрат 1024×1024), в то время как в Midjourney и Stable Diffusion доступны разные форматы.
Важный нюанс: Dall-E 3 не умеет редактировать существующие изображения так же гибко, как Midjourney с функцией Inpainting. Однако у неё есть функция Outpainting — дорисовывание фона исходного изображения.
Практические советы по созданию промптов в Dall-E 3
Хотя Dall-E 3 понимает естественную речь, есть несколько приёмов, которые помогут получить лучшие результаты. Во-первых, указывайте медиум. Если не сказать, что вы хотите получить — фото, картину, иллюстрацию или кадр из фильма, — нейросеть сгенерирует смешанные результаты. Если нужны фотографии, прямо пишите «реалистичное фото» или «профессиональное фото».
Во-вторых, используйте возможность влиять на «посредничество» GPT-4 в ChatGPT. Если нейросеть слишком радикально расширяет ваш запрос, попросите её создать короткий и лаконичный промпт. Если вы уверены в своём запросе, попросите вообще не модифицировать его. В Bing Image Creator такой возможности нет.
В-третьих, избегайте отрицаний. Нейросеть плохо понимает частицы «не», «без», «кроме». Вместо «без фона» лучше написать «на прозрачном фоне» или «изолированный объект». Вместо «не синий» — «красный».
В-четвёртых, не перегружайте запрос деталями. Длинные промпты с множеством элементов могут привести к тому, что нейросеть упустит часть из них. Лучше разбить сложную сцену на несколько простых запросов.
В-пятых, экспериментируйте с кнопкой «Удиви меня» в Bing Image Creator. Она генерирует случайные запросы и может натолкнуть на интересные идеи. Если запрос понравился, нажмите «Создать» — нейросеть сгенерирует четыре картинки.
Где можно применять Dall-E 3: от дизайна до образования
Dall-E 3 можно использовать в самых разных сферах. В графическом дизайне — для создания иллюстраций, обложек для соцсетей, рекламных буклетов и логотипов. Нейросеть хорошо справляется с генерацией текста на логотипах, хотя длинные надписи могут содержать ошибки. В маркетинге — для визуализации идей, создания контента для блогов и соцсетей.
В образовании Dall-E 3 может помочь в создании наглядных материалов: схем, графиков, иллюстраций к учебным текстам. Нейросеть умеет генерировать комиксы, что может быть полезно для объяснения сложных концепций. В медиа — для создания иллюстраций к статьям, особенно если нужно быстро получить визуал для новости или аналитического материала.
В архитектуре и дизайне интерьеров нейросеть может генерировать концептуальные изображения зданий и помещений. Хотя фотореализм уступает Midjourney, для эскизов и поиска идей Dall-E 3 подходит отлично. Также нейросеть можно использовать для генерации игровых локаций и персонажей.
Однако есть и ограничения. Dall-E 3 не подходит для создания бесшовных паттернов, точных чертежей или изображений с конкретными людьми. Также нейросеть не умеет генерировать изображения в стиле современных художников, что может быть критично для некоторых проектов.
Будущее Dall-E и альтернативные нейросети
OpenAI продолжает развивать линейку Dall-E. В марте 2023 года была представлена модель GPT-4, которая распознаёт не только текст, но и изображения. Пока она не внедрена в генераторы картинок, но в будущем это может изменить принципы работы нейросетей. Также ожидается появление API для Dall-E 3, что позволит разработчикам встраивать генерацию изображений в свои приложения.
Помимо Dall-E, существуют и другие нейросети для генерации изображений. Midjourney остаётся лидером по качеству фотореализма, но требует платной подписки и работы через Discord. Stable Diffusion — открытая модель, которую можно запустить локально, но для этого нужны мощные видеокарты. Также есть Kandinsky 3D от Сбера — первый в России открытый сервис для создания трёхмерных моделей по описанию.
Важно отметить, что рынок нейросетей быстро меняется. Появляются новые модели, улучшаются существующие, меняются условия доступа. Например, французский чат-бот Le Chat набрал 1 млн скачиваний для iOS, а создатели Claude выплатили $1,5 млрд писателям за использование их книг. Это показывает, что индустрия ИИ активно развивается, и пользователям стоит следить за новостями.
Вопросы и ответы
Как бесплатно пользоваться Dall-E 3 в России?
Самый простой способ — через Bing Image Creator. Перейдите на bing.com/images/create и войдите в учётную запись Microsoft. Если у вас Windows 8, 10 или 11, такая запись уже есть. В день даётся 25 быстрых генераций. После их исчерпания картинки создаются медленнее, но остаются бесплатными. Нейросеть понимает запросы на русском языке.
Чем Dall-E 3 отличается от Midjourney?
Dall-E 3 проще в использовании — не требует изучения синтаксиса промптов, понимает русский язык и доступна бесплатно. Midjourney даёт более качественный фотореализм и лучше справляется с художественными стилями, но требует платной подписки и работы через Discord. Dall-E 3 также имеет строгую цензуру и не генерирует знаменитостей.
Почему Dall-E 3 отказывается рисовать знаменитостей?
OpenAI ввела запрет на генерацию изображений знаменитостей и общественных деятелей «ради безопасности». Компания учла опыт Midjourney, где пользователи создавали фейковые снимки Папы Римского и ареста Дональда Трампа, которые затем выдавались за настоящие. Чтобы избежать дезинформации, Dall-E 3 блокирует такие запросы.
Можно ли использовать Dall-E 3 для коммерческих проектов?
Да, но с ограничениями. Нейросеть не генерирует изображения в стиле современных художников из-за авторских прав. Если вы создаёте логотип или иллюстрацию для бизнеса, убедитесь, что результат не нарушает чужих прав. OpenAI также позволяет художникам блокировать генерацию в стиле их работ, если они докажут, что нейросеть обучалась на их творчестве.
Как улучшить качество изображений в Dall-E 3?
Указывайте медиум в запросе — «реалистичное фото», «профессиональное фото», «иллюстрация». Если результат не устраивает, попросите нейросеть создать короткий промпт или вообще не модифицировать ваш запрос. В ChatGPT Plus можно влиять на работу GPT-4, который переписывает запросы. Избегайте отрицаний и слишком длинных описаний.
Какие форматы изображений поддерживает Dall-E 3?
По умолчанию нейросеть генерирует квадратные изображения 1024×1024 пикселя. В ChatGPT Plus можно указать горизонтальный (1792×1024) или вертикальный (1024×1792) формат. В Bing Image Creator изменить соотношение сторон нельзя. Все изображения сохраняются в формате PNG или JPG.
Сколько изображений можно создать за одну генерацию?
По одному запросу Dall-E 3 создаёт четыре изображения. В Bing Image Creator за это тратится одно «ускорение» из 25 доступных в день. В ChatGPT Plus количество генераций не ограничено, но подписка стоит 20 долларов в месяц. Если ускорения закончились, картинки создаются медленнее, но остаются бесплатными.