эйай ньюз

95.1K subscribers

This media is not supported in your browser
VIEW IN TELEGRAM
Просто жир! Пример того, насколько Luma становится лучше, когда на вход подаются первые кадры + пропмт.

Твитторский склеил целый клип – выглядит эффектно. Понятно, что человек потратил немало времени на черипикинг и промтинг. Все же, я бы сказал, что это близко к уровню черипикнутой СОРЫ – ну а другой СОРЫ мы ведь и не видели, т.к. ее никому не показывают хех.

@ai_newz
🔥207😍3214👍11💯6😁3❤‍🔥1🤯1🤩1
This media is not supported in your browser
VIEW IN TELEGRAM
This media is not supported in your browser
VIEW IN TELEGRAM
This media is not supported in your browser
VIEW IN TELEGRAM
This media is not supported in your browser
VIEW IN TELEGRAM
This media is not supported in your browser
VIEW IN TELEGRAM
This media is not supported in your browser
VIEW IN TELEGRAM
This media is not supported in your browser
VIEW IN TELEGRAM
This media is not supported in your browser
VIEW IN TELEGRAM
This media is not supported in your browser
VIEW IN TELEGRAM
This media is not supported in your browser
VIEW IN TELEGRAM
Вчера ещё зарелизили генерацию видео от Luma - очень достойный результат. Но кода или тех-репорта не будет, так как это сугубо продукт.

Я сделал для вас генерации с теми же промптами, что и Kling в предыдущем посте. А последние 3 видео - это черипики из твиттера, где на вход подавалось фото.

Мое комментарии по результатам:
- Генерит все также по 5 секунд, время генерации одного клипа сравнимо с Kling.
- Эстетическое качество хуже чем в Kling (если судить по первым попыткам). Однако гораздо больше движения в кадре, хоть оно иногда и не имеет смысла, как в случае с пандой или человеком, который должен был менять колесо в машине.
- Если же на вход подается первый кадр + промт, то результаты выходят заметно лучше. Можно прям классные ролиик создавать, генеря ключевые кадры с помощью MJ. Но опять же, видосы из твиттора сделаны не за одну попытку и требуют промпт инжениринга.

Еще видосы по похожим промптам есть у Саши в канале: пост.

Вы может потестить Luma сами, без вейтлиста: lumalabs.ai/dream-machine

@ai_newz
👍4614😁11🔥9❤‍🔥2😱2
This media is not supported in your browser
VIEW IN TELEGRAM
This media is not supported in your browser
VIEW IN TELEGRAM
This media is not supported in your browser
VIEW IN TELEGRAM
This media is not supported in your browser
VIEW IN TELEGRAM
This media is not supported in your browser
VIEW IN TELEGRAM
This media is not supported in your browser
VIEW IN TELEGRAM
This media is not supported in your browser
VIEW IN TELEGRAM
This media is not supported in your browser
VIEW IN TELEGRAM
Вот мой честный тест генерации видео с помощью Kling. Выбрал интересные промты из ваших комментариев, плюс добавил несколько своих.

Получаются видосы только по 5 секунд (увы), а генерация каждого занимает ~3 минуты. Как я понял, генерят на видеокартах A100, потому что США ввели полный запрет на поставку видеокарт H100 в Китай.

Комменнтарии по качеству:
- В Kling добились доволно высокого качества генерации людей и их лиц. Посмотрите на чела, поедающего пасту. Тут все очень реалистично вышло – от пальце рук до мимики лица. Правда модель не знает, кто такой Вилл Смит 😢. Еще небольшие артефакты всё же сть на ногах женщины на последнем видео (8) и на бегающих глазах программиста (6).
- Аниме получилось не очень, как будто наложил некий фильтр на реальное видео.
- Панда паркурит без артефактов, но вот движения почти нет.
- Забавно человек меняет колесо. Наверное в датасете не очень много сложных интеракций человека с предметами.
- Галактика выглядит прикольно, но как будто это зум-ин в статичное фото.

Промпты с Винни-Пухом и всем что связано с правительством, конечно же не проходят. Как сказал мой друг – Добро пожаловать в Китай, это базовые фильтры, которые есть во всех приложениях китайского интернета.

1. Will Smith eating pasta
2. Hatsune Miku dances on the concert stage in the middle of the camera, and holds a microphone in her hands, high quality masterpiece dance animation, anime video, MMD, Miku Miku Dance, from NicoNicoDouga
3. A panda doing parkour, jumping from a building to another building, doing somersault in the air
4. A man changes a car tire while the car is moving
5. A UFO lands in the park, shooting on an old smartphone
6. A group of software engineers in a meeting in a room
7. Near-light speed flight near the Andromeda galaxy
8. A 55 years old woman doing yoga asanas outside in a central park.

Итого, неплохая модель, довольно хорошо генерит людей, но страдает от недостатка движения, как и многие другие text2video модели.

Еще вот сравнение Kling с чери-пикнутыми видео от SORA: пост.

@ai_newz
86🔥44👍38😍3🫡2🦄1
YaFSDP - опенсорс либа от Яндекса для ускорения тренировки больших моделей

Современные LLM тренируются на огромных кластерах доходящих до десятков тысяч GPU. А так как один в поле не воин - им нужно постоянно общаться между собой, при этом когда в одну видеокарту веса моделей не влезают, их нужно шардить - распределять между многими видеокартами.

Основной метод шардинга сейчас - FSDP, он встроен в PyTorch и им пользуются абсолютно все. Но и он не идеален - имеет свойство выделять больше памяти, чем нужно, и простаивать на бэквард пассе.

Ребята из Яндекса решили эти проблемы и у них вышел YaFSDP - оптимизированная имплементация FSDP, лучшая из открыто доступных - на тренировке LLaMa 3 70B ускорение достигает 26%, при этом потребление памяти - меньше! А в Яндексе полная интеграция YaFSDP вообще позволила ускорить тренировку на 45%. Это напрямую транслируется в удешевление претрейна больших моделей.

Как такое возможно?

* Стратегические преалокации памяти позволяют сильно сбавить оверхед и использовать именно столько памяти, сколько нужно.

* Упорядочивание использования ресурсов так, чтобы на них не было сразу нескольких претендентов уменьшает простой видеокарты - не нужно ждать пока ресурсы освободятся.

* Оптимизированная нормализация уменьшает количество копирований на бэквард пассе.

Библиотека уже доступна на Github, с лицензией Apache 2.0 - то есть может пользоваться кто угодно, как угодно и абсолютно бесплатно.

@ai_newz
👍162🔥8325😁8❤‍🔥5🤩3
🔥Веса SD-3 Medium уже доступны!

Как и обещали, Stability релизнули Stable Diffusion 3 Medium с двумя миллиардами параметров. Она бесплатна для некоммерческого пользования. За коммерческое использование придётся платить: $20 в месяц для индивидуальных пользователей и небольших бизнесов, для бизнесов побольше - энтерпрайз лицензия.

Поддержка модели уже есть в ComfyUI, для автоматика придётся подождать.

Судя по публичным заявлениям сотрудников Stability, 8B модель ещё тренируется (что-то очень долго они ее уже тренируют). Но непонятно почему не релизнули 800m "Small" версии.

* В комментах пишут, что модель влазит в 6GB видео памяти.

* Скорость генерации: 12 sec/img на RTX 4070

Блогпост
Веса

@ai_newz
🔥12022👍11❤‍🔥8🙏31
Loading…
Культурно освещаю самые и не самые важные новости из мира…