Аниме-искусство всегда опиралось на особый визуальный язык: преувеличенные выражения лиц, четкие линии, драматическое освещение и стилизованные пропорции, которые отличают его от западных традиций иллюстрации. Десятилетиями создание такого рода искусства требовало многолетней практики с пером, планшетом или кистью. Этот барьер начал исчезать. Системы преобразования текста в изображение теперь позволяют любому описать сцену простым языком и получить готовую иллюстрацию за считанные секунды, созданную исключительно на основе этого описания, а не на основе фотографии-образца или эскиза, нарисованного от руки.
Этот сдвиг не произошёл в одночасье. Он стал результатом многолетних исследований моделей диффузии — математической основы, лежащей в основе большинства современных генераторов изображений, — в сочетании с огромным количеством обучающих данных, специфичных для аниме, предоставленных онлайн-сообществами. В результате появился инструмент, который понимает не только объекты и цвета, но и стилистические особенности, уникальные для аниме, от цел-шейдинга оттенков кожи до особого способа отображения прядей волос. Понимание того, как работает эта технология и что она означает как для художников, так и для любителей, помогает объяснить, почему создание произведений искусства на основе подсказок стало одним из наиболее обсуждаемых направлений в цифровой иллюстрации.
Как диффузионные модели превращают слова в иллюстрации
В основе большинства генераторов изображений в стиле аниме лежит метод, называемый диффузией. Проще говоря, модель начинает с холста, покрытого случайным визуальным шумом, и постепенно удаляет этот шум небольшими шагами, каждый раз приближая изображение к тому, что соответствует заданному текстовому описанию. Представьте себе скульптора, высекающего узоры на куске камня, только «камень» статичен, а «долото» управляется математическими предсказаниями, а не твердой рукой.
Текстовое описание, или подсказка, преобразуется в числовое представление, которое модель может сравнивать с частично сформированным изображением на каждом шаге. Такие слова, как «вишневые цветы», «двуххвостые волосы» или «драматическая подсветка», соответствуют шаблонам, которые модель усвоила во время обучения, шаблонам, взятым из огромных наборов данных размеченных произведений искусства. Когда подсказка достаточно конкретна, у модели есть более четкая цель, поэтому подробные подсказки, как правило, дают более согласованные результаты, чем расплывчатые.
Модели, разработанные специально для аниме, как правило, представляют собой доработанные версии универсальных систем распространения изображений. Разработчики берут универсальный генератор изображений и переобучают его на тщательно отобранных изображениях из аниме и манги, обучая его визуальной грамматике этого жанра: плоским цветовым полям, четким контурам, стилизованным глазам и особым анатомическим пропорциям, отличающимся от фотореалистичного изображения. Компания Lovescape построила свой генератор хентая на основе искусственного интеллекта, используя ту же логику тонкой настройки, применяя принципы распространения к конкретному направлению аниме-стиля и демонстрируя, насколько широко может быть адаптирована базовая технология.
Качество выходных данных также зависит от того, как модель обрабатывает композицию и анатомию — две области, в которых ранние версии этой технологии испытывали заметные трудности. Часто в ранних инструментах диффузии жаловались на руки со слишком большим количеством пальцев или на размытый фон. Новые архитектуры значительно улучшились в этом отношении, отчасти благодаря более качественной обработке обучающих данных, а отчасти благодаря методам, которые придают модели более четкое представление о пространственной структуре до начала детализации.
Расширяющийся набор инструментов для создания аниме-арта по подсказкам.
Ландшафт инструментов для создания аниме-изображений значительно расширился, выйдя за рамки одной доминирующей платформы. Некоторые сервисы основаны на открытых фреймворках для распространения изображений, которые разработчики могут модифицировать и переобучать, в то время как другие работают как закрытые платформы со своими собственными проприетарными моделями. Это разнообразие важно, потому что разные инструменты преуспевают в разных областях: одни отдают приоритет скорости и доступности, другие фокусируются на точном контроле над позой и композицией, а меньший набор ориентирован на нишевые поджанры в рамках аниме-стиля.
Модели, созданные сообществом, сыграли огромную роль в формировании этой экосистемы. Вместо того чтобы ждать, пока крупные компании выпустят инструменты, совместимые с аниме, разработчики-любители и небольшие команды опубликовали свои собственные, тщательно настроенные контрольные точки, часто обученные на определенных художественных стилях, архетипах персонажей или эстетике студии. Эти разработки сообщества свободно распространяются, позволяя пользователям комбинировать различные обученные модели в зависимости от желаемого внешнего вида.
Наряду с самими моделями, развилась экосистема вспомогательных инструментов, предоставляющих пользователям более тонкий контроль. Дополнительные технологии позволяют создателям фиксировать определенную позу, переносить цветовую палитру с эталонного изображения или сохранять единообразие черт характера на нескольких сгенерированных изображениях. Эти элементы управления устраняют одну из самых ранних критических замечаний в адрес искусства, основанного на подсказках: результаты были слишком случайными и сложными для достижения точного творческого замысла.
Подсказки для создания поделок, которые действительно работают
Составление эффективного задания — это не столько дача неформальной инструкции, сколько составление технического описания. Успешные задания часто располагают информацию в определённом порядке: сначала описание объекта, затем стилистические характеристики, а потом детали освещения, ракурса камеры и фона. Задание, которое просто гласит «аниме-девушка», даст общий результат, в то время как задание, указывающее цвет волос, выражение лица, стиль одежды и обстановку, предоставляет модели гораздо больше возможностей для работы.
Многие опытные пользователи полагаются на терминологию, заимствованную из фотографии и искусствоведения, чтобы управлять результатами. Такие термины, как «контурное освещение», «вид в три четверти» или «малая глубина резкости», несут в себе специфическое визуальное значение, которое модель научилась ассоциировать с соответствующими паттернами в своих обучающих данных. Эта общая терминология функционирует как мост между человеческим замыслом и машинной интерпретацией, позволяя создателям передавать тонкие визуальные идеи, не рисуя ничего самостоятельно.
Отрицательная подсказка, практика указания того, что следует исключить из изображения, стала столь же важной, как и описание того, что следует включить. Пользователи часто перечисляют нежелательные черты, такие как лишние конечности, размытый фон или несоответствующие пропорции, что помогает модели избежать распространенных ошибок. Этот метод отражает то, насколько инженерия подсказок развилась в самостоятельный полутехнический навык, отличный от традиционного рисования, но требующий своего рода отточенной интуиции.
Что это значит для традиционных художников аниме?
Распространение генерации изображений на основе подсказок, естественно, вызвало беспокойство в части традиционного сообщества иллюстраторов. Художники, которые годами осваивали анатомию, перспективу и теорию цвета, теперь видят, как программное обеспечение за считанные секунды выдает сопоставимые результаты, что вызывает обоснованные опасения по поводу того, как это повлияет на работу на заказ и доход фрилансеров. Некоторые иллюстраторы отреагировали на это, внедрив инструменты ИИ в свой рабочий процесс, используя сгенерированные изображения в качестве отправной точки для дальнейшей ручной обработки, а не рассматривая технологию как замену.
Вопросы авторского права и обучающих данных остаются нерешенными во многих юрисдикциях. Поскольку эти модели обучаются на обширных коллекциях существующих произведений искусства, часто собранных без индивидуального разрешения первоначальных создателей, продолжаются дебаты о том, являются ли сгенерированные результаты производными работами и какая компенсация, если таковая имеется, полагается оригинальным авторам. Эти вопросы рассматриваются по-разному в разных странах, при этом некоторые регулирующие органы быстрее других устанавливают четкие правила.
В то же время, инструменты, основанные на подсказках, открыли творческие возможности для людей, которые никогда не имели доступа к традиционному художественному образованию. Писатели, желающие визуализировать персонажей, небольшие разработчики игр, нуждающиеся в условных изображениях, и любители, экспериментирующие с оригинальными концепциями, теперь могут создавать визуальный материал, для которого раньше потребовалось бы нанять иллюстратора или потратить годы на обучение рисованию. Эта демократизация не отменяет ценность профессионального художественного мастерства, но она меняет круг лиц, имеющих возможность участвовать в визуальном повествовании.
Перспективы развития аниме-арта, созданного с помощью ИИ.
Технология создания аниме-изображений всё ещё молода, и темпы её совершенствования говорят о том, что существующие ограничения в отношении согласованности, анатомии и точного контроля будут продолжать стираться. По мере того, как инструменты становятся всё более способными поддерживать целостность персонажей на нескольких изображениях, грань между иллюстрацией с помощью ИИ и традиционным художественным производством, вероятно, будет ещё больше размываться, побуждая художников, платформы и регулирующие органы постоянно адаптироваться к среде, которая продолжает переосмысливать понятие создания аниме-арта, начиная всего лишь с письменного описания.
