эйай ньюз

95.1K subscribers

This media is not supported in your browser
VIEW IN TELEGRAM
OpenAI добавили в DALLE-2 новую фичу – дорисовывание картинки наружу, или outpainting. Раньше это можно было делать только хаками с помощью уменьшения оригинальной картинки и добавления маски по краям. А теперь по-сути можно бесконечно увеличивать размер полотна.

https://openai.com/blog/dall-e-introducing-outpainting/

@ai_newz
97👍38🤩1
MultiNeRF: A Code Release for Mip-NeRF 360, Ref-NeRF, and RawNeRF

Если ищете SOTA метод по нейронному рендерингу сцены, то Гугл выложили репозиторий с реализацией трёх oral статей с CVPR 2022. Это топовые на сегодняшний день методы.

Oral - это значит, что статья попала в шорт-лист лучших работ на конференции.

Ссылка на репу

@ai_newz
🔥19👍6
NSFW заказывали? Кто-то говорил, что у прон художников пока работа будет всегда. Я уже засомневался.

Тут уже зафайнтюнили модельку (похоже на Stable Diffusion) под это пикантное дело. Ух, как закукарекают в твиттере!

Фото постить не буду, сами посмотрите: https://pornpen.ai/
🔥73👍8👎76🤔5😱3
This media is not supported in your browser
VIEW IN TELEGRAM
Вот вам пацанский подгон от Meta RL. Датасет с высококачественными лицами одновременно с нескольких ракурсов – Multiface. Он использовался для обучения энкодера для Codec Avatars [тут и тут]. Будет полезен для всякого рода работ с нейронным рендерингом лиц.

❱❱ Датасет
❱❱ Статья

@ai_newz
👍47
Media is too big
VIEW IN TELEGRAM
Пошло в массы. Теперь уже появился плагин для Фотошопа со Stable Diffusion. Дизайнеры, вы там держитесь! И покупайте видеокарты побольше!

Getalpaca.io

@ai_newz
🔥141🤡14👍72😁2🤩1
This media is not supported in your browser
VIEW IN TELEGRAM
MoCapDeform: Monocular 3D Human Motion Capture in Deformable Scenes

Тут прикольную задачу решают - моделируют деформацию предметов под пятой точкой испытуемого. За счет этого получают более стабильные предсказания тела человека в 3D.

На вход принимается RGB картинка c кожаным человеком и меш сцены.

Paper
Project page

@ai_newz
👍17🤬21🤩1
Сейчас в твиттере хайпует статья Cold Diffusion: Inverting Arbitrary Image Transforms Without Noise. Авторы ставят под сомнение теорию, стоящую за диффузионными генеративными моделями, основной принцип которых строится на добавлении и удалении гауссовского шума. Ребята покумекали и показали, что вместо использования случайного гауссовского шума можно использовать и другие деструктивные операции над изображениями, например блюр, маскинг, даунсэмплинг, заснежение и др. Это довольно неожиданно, так как в этом случае нет теоретически гарантий. На практике работает тоже сносно, хоть и немного хуже чем гауссовскиц шум.

Я думаю, это довольно интересная рапира. Она проверяет насколько подогнанная теория строго выполняется на практике. Будем следить за дальнейшем развитием "обобщенной диффузии" в следующих статьях.

Кодяра
Папирус

@ai_newz
👍57🔥152
Доброе утро, народ! Вот вам пять строк, как запустить Stable Diffusion у себя на коленке. Не перегрейтесь!

Тут более подробный туториал.

@ai_newz
👏69🔥30👍147❤‍🔥1
This media is not supported in your browser
VIEW IN TELEGRAM
У дезигнеров бушует фантазия, создают вот такие концепты модных шмоток с помощью инпейнтинга в далле-2.

На видео около 100 генераций.

@ai_newz
🔥1096👍5😢3👎2
Познавательная лекция от Michael Zollhöfer, ученого из Meta Reality Labs, о разработках в области теле-присутствия: реалистичные аватары, живой звуке в метаверсе, нейронный рендеринг для пространств и прочие крутые штуки.

Лекция

@ai_newz
🔥13👍9
This media is not supported in your browser
VIEW IN TELEGRAM
Пока половина интернета носится со стейбл диффузией, другие люди делают реальные научные прорывы.

FAIR/MetaAI выпустили ESM2 – языковую модель для протеинов (до 15 млрд параметров), которая на уровне с AlphaFold по точности, но на порядок быстрее. Что открывает новые возможности для использования ее реальными молекулярными биологами в повседневной работе.

Одна из многих задач, которую умеет решать модель - это восстановление полной атомарной структуры белка, по небольшой входной последовательности.

❱❱ Статья
❱❱ Код и веса

@ai_newz
🔥77👍156🤯1
Веса Stable Diffusion официально релизнули в открытый доступ. Выкуси, OpenAI.

https://stability.ai/blog/stable-diffusion-public-release

Новый чекпоинт тут.
Что такое Stable Diffusion тут.

@ai_newz
80🔥13👍5😱3
Forwarded from Derp Learning
Народная версия кода #stablediffusion для пролетариата!
512x512 теперь влезает даже в 4гб карточки!

Вы только посмотрите на эти счастливые лица промт инженеров из светлого будущего!


Реализация довольно простая - везде half precision, и всё, что в данный момент не используем, кладем на cpu.

Гит

@derplearning
🔥42👍114👎2👏1😁1
This media is not supported in your browser
VIEW IN TELEGRAM
Stable Diffusion стартовал вторую фазу беты и вышел из дискорда в веб. Любому желающему бесплатно дают кредитов на 200 генераций, а дальше за золотишко.

Я потыкал, и вот что у меня вышло. Честно сказать, если хочется что-то нормальное сгенерить, то 200 кредитов улетают со скоростью света, потому что в большинсвте своём генерится дегенеративный арт, а не дизайнерские конфетки.

Промт-инжениринг дело не легкое. Очевидно, что в скрытом пространстве сети только некоторые индивидуальный точки выглядят красиво и эстетично, и уходит много времени, чтобы их нащупать. В идеале, следующее поколение генеративных сетей должно решать именно эту проблему. Подбор промптов автоматически - это первый уродливый костыль в том направлении.

@ai_newz
👍35🔥112🤔2👎1😁1
Multimodal Learning with Transformers: A Survey

Все любят миксы 😁, особенно миксы разных модальностей при обучении сетей, например текст и фото, видео и аудио и т.д.. Из комбинации сигналов разных модальностей зачастую можно получить более богатый информацией сигнал.

Трансформеры как раз хорошо справляются с задачей моделирования кросс-модальных зависимостей.

В этой свежей статье-ревью авторы провели обзор трансформеров для мультимодаьных данных. От базовых принципов, до более сложных моделей для конкретных задач. Довольно полезная папира.

❱❱ PDF

@ai_newz
👍17🔥9
Ввиду всех этих далле и стабильных диффузий, предлагаю вашему вниманию CLIP-Допрашиватель! Штука помогает человеку без фантазии разобрать картинку в промпт с правильными ключевыми словами. То есть понравилась картинка - запихнул ее в интеррогатор, получил промпт и сгенерил еще кучу вариаций с помощью любимой диффузии.

Как работает? (а) Делаем captioning входной картинки с помощью BLIP. Затем пробегаемся по словарю стилей, жанров, течений в искусстве и арт платформ, и (b) с помощью CLIP находим наиболее релевантные для входной картинки. Комбинация (а) и (b) будет итоговым промптом.

Результат моего теста - на картинках:
1. Входное фото. Интеррогатор выдал «a little girl standing in front of a fire, a stock photo by Marina Abramović, shutterstock contest winner, tachisme, furaffinity, destructive, stock photo»
2. Выход Stable Diffusion по этому промпту.

Enjoy!

❱❱ Google colab

@ai_newz
🔥45👍20😁52👎2👏1
Занятная ботанская картинка показывающая таксономию и связи между различными мерами и расстояниями.

Хозяйке на заметку.

@ai_newz
51👍21🤩4🔥1🤯1
В статье про PaLM дохульен авторов, но у двух первых взяли интервью. Кстати еще одна новость в том, что Google Research сегодня запустил свой канал на ютубе, где они будут регулярно постить интервью с ресерчерами и короткие видео про свои SOTA статьи. В общем, я подписался.
👍27😍7🔥3
Loading…
​Познавательная лекция от Michael Zollhöfer, ученого из…