⚡️Lightning Studio: Альтернатива Google Colab если хотите поиграться c модельками или заняться пет-проектом
Я тут случайно набрел на такую штуку. Не знал, что Lightning, та контора, что делает фреймворк Pytorch Lightning, ещё и пилит свою студию. По сути это онлайн среда для разработки и прототипирования deep-learning моделек. Тут все что нужно есть: и терминал, и VS Code, и ноутбуки, и удобный доступ к файловой системе и persitent хранилище (а не грёбаный google drive).
Фичи, которые есть тут, но нет в Google Colab:
- free persistent storage, то есть локальные файлы не пропадают, когда вы закрыли ноутбук
- free persistent environments
- unlimited background execution
- VSCode, PyCharm, (any IDE) integration
Дают бесплатно 22 гпу-часов (T4) в месяц, плюс можно докупить еще, если нужно. Платишь только за время, когда GPU активирована. Можно отмасштабировать и арендовать 8xA100, если нужно натренировать что-то серьезное.
https://lightning.ai/
@ai_newz
Я тут случайно набрел на такую штуку. Не знал, что Lightning, та контора, что делает фреймворк Pytorch Lightning, ещё и пилит свою студию. По сути это онлайн среда для разработки и прототипирования deep-learning моделек. Тут все что нужно есть: и терминал, и VS Code, и ноутбуки, и удобный доступ к файловой системе и persitent хранилище (а не грёбаный google drive).
Фичи, которые есть тут, но нет в Google Colab:
- free persistent storage, то есть локальные файлы не пропадают, когда вы закрыли ноутбук
- free persistent environments
- unlimited background execution
- VSCode, PyCharm, (any IDE) integration
Дают бесплатно 22 гпу-часов (T4) в месяц, плюс можно докупить еще, если нужно. Платишь только за время, когда GPU активирована. Можно отмасштабировать и арендовать 8xA100, если нужно натренировать что-то серьезное.
https://lightning.ai/
@ai_newz
🔥243❤22👍16❤🔥7⚡6
Training Retrieval Augmented Generation With Ola Piktus
Послушал подкастик с ресерч-инженером из Cohere, Александрой Пиктус, которая отвечает за RAG в той самой языковой модели Command R+.
Олу я знаю еще с 2019 года, когда я был в Лондоне на стажировке в FAIR. Так получилось, что мы сидели за соседними столами. Тогда она делала Hackamonth в NLP-команде Лондонского FAIR. Hackamonth – это когда ты устал от привычной рутины, и идёшь на месяц поработать в другую команду, занимаясь полностью другим проектом в новой области. Очень крутая штука для обмена опыта между командами.
В итоге после хакамесяца Ола полностью перешла в FAIR на позицию Research Engineer.
Меня часто спрашивают, можно ли перекатиться на ресерч позицию, если ты Software engineer без PhD. Как раз на примере Олы можно проследить, как она это сделала, она об это рассказывает в начале подкаста. Конечно, для такого пивота немаловажна удача (ей очень повезло с командой) и вообще попасть в FAANG хотя бы на SWE. Ола, кстати, рассказала, что у нее получилось попасть в Мету не с первой попытки, и что самое главное — это хорошо подготовиться к собесам (с этим я полностью согласен).
Два года назад Ола ушла из Меты, затем поработала в Hugging Face, а сейчас она пилит RAG для моделек в Cohere.
Она варится в NLP c 2019 года, и является соавтором многих статьей, в том числе той, в которой изначально и предложили метод RAG: Retrieval-Augmented Generation for Knowledge-Intensive NLP Tasks.
В подкасте Ола на довольно простом языке объясняла базовые принципы работы RAG так, что поймут даже новички в теме.
Кстати, мне очень близка точка зрения Александры о том, почему LLM галлюцинируют:
YouTube
Spotify
#карьера
@ai_newz
Послушал подкастик с ресерч-инженером из Cohere, Александрой Пиктус, которая отвечает за RAG в той самой языковой модели Command R+.
Олу я знаю еще с 2019 года, когда я был в Лондоне на стажировке в FAIR. Так получилось, что мы сидели за соседними столами. Тогда она делала Hackamonth в NLP-команде Лондонского FAIR. Hackamonth – это когда ты устал от привычной рутины, и идёшь на месяц поработать в другую команду, занимаясь полностью другим проектом в новой области. Очень крутая штука для обмена опыта между командами.
В итоге после хакамесяца Ола полностью перешла в FAIR на позицию Research Engineer.
Меня часто спрашивают, можно ли перекатиться на ресерч позицию, если ты Software engineer без PhD. Как раз на примере Олы можно проследить, как она это сделала, она об это рассказывает в начале подкаста. Конечно, для такого пивота немаловажна удача (ей очень повезло с командой) и вообще попасть в FAANG хотя бы на SWE. Ола, кстати, рассказала, что у нее получилось попасть в Мету не с первой попытки, и что самое главное — это хорошо подготовиться к собесам (с этим я полностью согласен).
Два года назад Ола ушла из Меты, затем поработала в Hugging Face, а сейчас она пилит RAG для моделек в Cohere.
Она варится в NLP c 2019 года, и является соавтором многих статьей, в том числе той, в которой изначально и предложили метод RAG: Retrieval-Augmented Generation for Knowledge-Intensive NLP Tasks.
В подкасте Ола на довольно простом языке объясняла базовые принципы работы RAG так, что поймут даже новички в теме.
Кстати, мне очень близка точка зрения Александры о том, почему LLM галлюцинируют:
Ultimately, this is about the probability of the next word. The model is not building some sort of internal structure of the world and it's not the truth machine. It's doesn't have the ability to build a model of reality. It' primarily about the text and what is written.
YouTube
Spotify
#карьера
@ai_newz
YouTube
Training Retrieval Augmented Generation With Ola Piktus
In today's episode, I chat about retrieval-augmented generation (RAG) with Ola Piktus, Member of Technical Staff at Cohere. With her roots in software engineering and significant contributions to RAG through her research, Ola has an interesting perspective…
🔥67❤32👍16🦄5😁3❤🔥2
Еще раз обо мне
В канал пришло много новых людей, решил еще раз представиться и сделать подборку интересных постов.
Меня зовут Артём, я из Беларуси. Сейчас живу в Швейцарии и работаю в Meta GenAI на позиции Staff Research Scientist. До этого сделал PhD в университете Хайдельберга, в той самой научной группе, где придумали Stable Diffusion. За время в лабе я опубликовал кучу статей на топовых конфах. В перерывах между статьями я оттачивал свои эйай навыки на практике, упарываясь на Kaggle соревнованиях (я очень азартный тип в этом плане) – добрался до Top45 в мировом рейтинге с несколькими золотыми медалями. Больше про меня есть в этом посте и по тегам #personal и #мойпуть. [Если что, то я на фотке слева]
Подборка личных постов:
▪️Рассказ о том, как я вкатился в AI/ML
▪️Откуда AI хайп и как было, когда я начинал свое PhD
▪️Видео-интервью со мной
▪️Вот здесь делюсь личной радостью, ведь мы завезли диффузию в инсту,
▪️На основе emu, которую лично я оптимизировал, чтоб вот быстро и чётко
▪️Еще про то как мы сделали и ускорили генеративные стикеры для инсты, WhatsApp и FB Messenger.
▪️Про наш громкий релиз Imagine Flash, риалтайм генерацию картинок – проект, который я вел.
▪️Моя статья об ускорении диффузии с помощью кеширования, без потери качества конечно же.
▪️Как я приделывал ноги Аватарам в метаверсе [ч1, ч2], пока работа в Meta Reality Labs.
▪️Пост-апдейт и про, то как я недавно стал стафом в Meta GenAI (ну вы поняли).
Из еще почитать:
▪️Пост про грейды в бигтехе [ч1, ч2]. Все же в курсе, что сеньор это еще не все?:)
▪️Список книг для изучения ML в 2024.
▪️Гайд по ускорению диффузии [ч1, ч2], так сказать полевой опыт.
▪️Разбор того, как дистиллировали sd3 в 4 шага, который репостнулCEO бывший CEO Stability
▪️Список лекций и туториалов про 3D Human Understanding от топовых ученых из этой сферы.
▪️Лонгрид про парижский стартап Mistral и мое знакомство с фаундером.
▪️Пост про GR00T, модельку от nvidia, которая может стать chatgpt моментом в робототехнике.
▪️Еще вот про те самые чаевые в $200 для LMM и финальный список всех трюков, чтобы вставить в промпт по умолчанию.
Недавно запустился еженедельный #дайджест с кратким обзором новостей.
А также в ленте можно найти 1000 и 1 разбор свежих пейперов с мои авторитетным мнением, еще есть рубрика #ликбез с разбором базовых тем и #карьера с моими мыслями/байками по карьере в AI/ML.
Ну что, поздравляю всех новоприбывших! Обнял ❤️
@ai_newz
В канал пришло много новых людей, решил еще раз представиться и сделать подборку интересных постов.
Меня зовут Артём, я из Беларуси. Сейчас живу в Швейцарии и работаю в Meta GenAI на позиции Staff Research Scientist. До этого сделал PhD в университете Хайдельберга, в той самой научной группе, где придумали Stable Diffusion. За время в лабе я опубликовал кучу статей на топовых конфах. В перерывах между статьями я оттачивал свои эйай навыки на практике, упарываясь на Kaggle соревнованиях (я очень азартный тип в этом плане) – добрался до Top45 в мировом рейтинге с несколькими золотыми медалями. Больше про меня есть в этом посте и по тегам #personal и #мойпуть. [Если что, то я на фотке слева]
Подборка личных постов:
▪️Рассказ о том, как я вкатился в AI/ML
▪️Откуда AI хайп и как было, когда я начинал свое PhD
▪️Видео-интервью со мной
▪️Вот здесь делюсь личной радостью, ведь мы завезли диффузию в инсту,
▪️На основе emu, которую лично я оптимизировал, чтоб вот быстро и чётко
▪️Еще про то как мы сделали и ускорили генеративные стикеры для инсты, WhatsApp и FB Messenger.
▪️Про наш громкий релиз Imagine Flash, риалтайм генерацию картинок – проект, который я вел.
▪️Моя статья об ускорении диффузии с помощью кеширования, без потери качества конечно же.
▪️Как я приделывал ноги Аватарам в метаверсе [ч1, ч2], пока работа в Meta Reality Labs.
▪️Пост-апдейт и про, то как я недавно стал стафом в Meta GenAI (ну вы поняли).
Из еще почитать:
▪️Пост про грейды в бигтехе [ч1, ч2]. Все же в курсе, что сеньор это еще не все?:)
▪️Список книг для изучения ML в 2024.
▪️Гайд по ускорению диффузии [ч1, ч2], так сказать полевой опыт.
▪️Разбор того, как дистиллировали sd3 в 4 шага, который репостнул
▪️Список лекций и туториалов про 3D Human Understanding от топовых ученых из этой сферы.
▪️Лонгрид про парижский стартап Mistral и мое знакомство с фаундером.
▪️Пост про GR00T, модельку от nvidia, которая может стать chatgpt моментом в робототехнике.
▪️Еще вот про те самые чаевые в $200 для LMM и финальный список всех трюков, чтобы вставить в промпт по умолчанию.
Недавно запустился еженедельный #дайджест с кратким обзором новостей.
А также в ленте можно найти 1000 и 1 разбор свежих пейперов с мои авторитетным мнением, еще есть рубрика #ликбез с разбором базовых тем и #карьера с моими мыслями/байками по карьере в AI/ML.
Ну что, поздравляю всех новоприбывших! Обнял ❤️
@ai_newz
Telegram
эйай ньюз
Словился со своим кентом Яном ЛеКуном на ICCV.
#personal
@ai_newz
#personal
@ai_newz
2❤343👍123🔥111❤🔥11😁8🙏7🦄6😍4⚡3💯3🤩2
This media is not supported in your browser
VIEW IN TELEGRAM
Помните, по сети гулял недавно серьезный сервис Magnigic AI для креативного апскейла картинок? Все бы ничего, но удовольствие такое стоит $40.
Так вот... Оказывается, Леонардо в тихую запустил такую же тулзу бесплатно! В день там даются 150 токенов, чего хватает на 5 апскейлов до 5 мегапикселей (в бесплатной версии). То есть разрешение после Дали увеличить получиться только в 1,5 раза, но зато появится детализация. После, при желании, можно прогнать картинку еще через какой-нибудь апсейлер типа топаза или upscale media (разрешение до 1500х1500) и получить полноценный 4K (пример файлом).
Предположительно работает это так:
Сначала апскейлишь картинку билинейно (обычный апскейл), добавляешь нойза, режешь это все на тайлы (куски) с нахлестом и скармливашь каждый зашумленный кусок в Stable Diffusion (с контролнетом или без), усредняя результат в области пересечения тайлов после каждого шага. В конце собираешь все обратно.
В a1111 плагин называется ControlNet Tiles, штука старая и довольно известная, позволяет получить картинки вплоть до 32,000 и более пикселей, а также апскейлить на слабом железе. Здесь, в общем, то же самое, но довольно быстро (секунд за 30) и в удобном интерфейсе. Доводить картинки из Dalle 3 до уровня Миджорни самое то!
Leonardo
@ai_newz
Так вот... Оказывается, Леонардо в тихую запустил такую же тулзу бесплатно! В день там даются 150 токенов, чего хватает на 5 апскейлов до 5 мегапикселей (в бесплатной версии). То есть разрешение после Дали увеличить получиться только в 1,5 раза, но зато появится детализация. После, при желании, можно прогнать картинку еще через какой-нибудь апсейлер типа топаза или upscale media (разрешение до 1500х1500) и получить полноценный 4K (пример файлом).
Предположительно работает это так:
Сначала апскейлишь картинку билинейно (обычный апскейл), добавляешь нойза, режешь это все на тайлы (куски) с нахлестом и скармливашь каждый зашумленный кусок в Stable Diffusion (с контролнетом или без), усредняя результат в области пересечения тайлов после каждого шага. В конце собираешь все обратно.
В a1111 плагин называется ControlNet Tiles, штука старая и довольно известная, позволяет получить картинки вплоть до 32,000 и более пикселей, а также апскейлить на слабом железе. Здесь, в общем, то же самое, но довольно быстро (секунд за 30) и в удобном интерфейсе. Доводить картинки из Dalle 3 до уровня Миджорни самое то!
Leonardo
@ai_newz
👍80🔥26❤10😍4🦄3
Mistral как обычно в своем стиле, тупо оставили magnet-ссылку на торрент с весами своей новой модели. Вот знатные троли.
Новая модель это Mixture of Experts Mixtral-8x22B:
- Размер модели 262 GB (я так понимаю веса в fp16)
- 8 экспертов / 2 активных
- В сумме 141 B параметров / активных 39B
- 56 слоев, hidden_dim=16384, 48 attention голов
- Размер контекста 65536 токенов.
Обстановочка в гонке моделей накаляется с каждым днем. Кажется, Command R+ могут подвинуть на лидерборде! Weclome to ARENA!
@ai_newz
🔥160❤26👍19🤯4😱2🦄1
Ну, что, любители сэма альтмана, вышел апдейт GPT-4 (
Смотря невооруженным глазом, ничего особо не поменялось. Только теперь в модель можно пихать картинки через API, то есть это GPT-4V версия, и она теперь доступна всем.
Анонсы твердят, что это "значительное" улучшение, особенно по части математических способностей.
Что-ж, дождемся результатов Chatbot-арены, где в честном бою выяснится, кто сильнее Claude 3 Opus или GPT-4.
Напомню, что недавно Claude 3 Opus стал лучшей моделью на Chatbot-арене, побив долгоиграющего лидера GPT-4.
А сегодня открытая моделька Cohere Command R+ (писал о ней тут) вышла на 6-е место, побив старые версии GPT-4. И это не может не радовать!🎉
@ai_newz
gpt-4-turbo-2024-04-09). Смотря невооруженным глазом, ничего особо не поменялось. Только теперь в модель можно пихать картинки через API, то есть это GPT-4V версия, и она теперь доступна всем.
Анонсы твердят, что это "значительное" улучшение, особенно по части математических способностей.
Что-ж, дождемся результатов Chatbot-арены, где в честном бою выяснится, кто сильнее Claude 3 Opus или GPT-4.
Напомню, что недавно Claude 3 Opus стал лучшей моделью на Chatbot-арене, побив долгоиграющего лидера GPT-4.
А сегодня открытая моделька Cohere Command R+ (писал о ней тут) вышла на 6-е место, побив старые версии GPT-4. И это не может не радовать!
@ai_newz
❤92🔥47👍23🤯1💯1
Андрей Карпатый выпустил llm.c – тысяча строк чистого C без зависимостей, которые компилируются меньше чем за секунду. llama.c – его предыдущий проект, позволявший запускать llama на всяких умных лампочках, а llm.c теперь даёт возможность ещё и тренировать.
МОЁ УВОЖЕНИЕ
Пока что можно только тренировать GPT-2 на CPU, но Андрей уже работает над поддержкой CUDA и более новых моделей вроде llama. Когда закончит - обещает выпустить несколько туториалов про это, в духе его же видео о написании GPT-2 на Python.
https://github.com/karpathy/llm.c
@ai_newz
GitHub
GitHub - karpathy/llm.c: LLM training in simple, raw C/CUDA
LLM training in simple, raw C/CUDA. Contribute to karpathy/llm.c development by creating an account on GitHub.
🤯222🔥104❤29👍15❤🔥6😁3😍2
JetMoE: так выглядит бюджетный претрейнинг в 2024
Модель - 8B MoE (2.2B - активные) на уровне прошлогодней LLaMA 2 7B. Из архитектурных особенностей - Mixture of Experts там не только MLP, но и Attention.
Авторы хвастаются, что потратили всего ~32k H100-часов (две недели трейна на 96×H100) с датасетом в 1.25 триллиона токенов. Тренили в две стадии: сначала триллион не самых качественных токенов, а за ним 250 миллиардов википедии, архива и т.д.. Потратили на все про все 80 тысяч долларов, это, считай, копейки по меркам современных LLM. Для сравнения, Лламу 2 тренировали ~180k A100 часов на 2 триллионах токенов.
Моделька не лучшая - в своей весовой категории по компьюту она уступает Qwen1.5-MoE-A2.7B (у которой в два раза больше параметров), но бьёт Gemma 2B и Stable LM 1.6B (не удивительно). Среди моделей с одинаковым количеством параметров она проигрывает Mistral-7B и Gemma 7B. Но зато она довольно дешёвая в тренировке и может быть хорошей отправной точкой для специализированных файнтюнов.
Вообще мне очень нравится тренд на удешевление тренировки, и на уменьшение моделей. За этим будущее, где LLM-ки или их потомки бегают на каждом электрочайнике.
Демка
Веса
Сайт модели
@ai_newz
Модель - 8B MoE (2.2B - активные) на уровне прошлогодней LLaMA 2 7B. Из архитектурных особенностей - Mixture of Experts там не только MLP, но и Attention.
Авторы хвастаются, что потратили всего ~32k H100-часов (две недели трейна на 96×H100) с датасетом в 1.25 триллиона токенов. Тренили в две стадии: сначала триллион не самых качественных токенов, а за ним 250 миллиардов википедии, архива и т.д.. Потратили на все про все 80 тысяч долларов, это, считай, копейки по меркам современных LLM. Для сравнения, Лламу 2 тренировали ~180k A100 часов на 2 триллионах токенов.
Моделька не лучшая - в своей весовой категории по компьюту она уступает Qwen1.5-MoE-A2.7B (у которой в два раза больше параметров), но бьёт Gemma 2B и Stable LM 1.6B (не удивительно). Среди моделей с одинаковым количеством параметров она проигрывает Mistral-7B и Gemma 7B. Но зато она довольно дешёвая в тренировке и может быть хорошей отправной точкой для специализированных файнтюнов.
Вообще мне очень нравится тренд на удешевление тренировки, и на уменьшение моделей. За этим будущее, где LLM-ки или их потомки бегают на каждом электрочайнике.
Демка
Веса
Сайт модели
@ai_newz
❤64👍36🔥17😍4❤🔥1
Наверное кое-кто из вас уже слышал про ШАД (Школа Анализа Данных от Яндекса). Это одна из немногих программ на русском языке, которая дает очень серьезную базу по ML.
Я сам закончил ШАД в 2014 в Беларуси (там тоже есть филиал), когда про нейронные сети ещё мало кто слышал. И это дало мне начальный импульс строить свою карьеру в ML. Короче, советую.
Обучение в ШАДе бесплатное, однако конкурс высокий — в прошлом году он был 17 человек на место. Но ради карьерного буста можно и постараться: по опросу, 8 из 10 выпускников работают в топовых технологических компаниях, а каждый четвёртый идёт в науку (типа меня).
Учиться в ШАДе можно как очно, так и удаленно.
Кстати, сейчас там преподает Елена Войта, которая работает ресерчером в Meta AI и ведет курс по NLP.
Подать заявку можно до 12 мая. Сайт ШАДа.
@ai_newz
Я сам закончил ШАД в 2014 в Беларуси (там тоже есть филиал), когда про нейронные сети ещё мало кто слышал. И это дало мне начальный импульс строить свою карьеру в ML. Короче, советую.
Обучение в ШАДе бесплатное, однако конкурс высокий — в прошлом году он был 17 человек на место. Но ради карьерного буста можно и постараться: по опросу, 8 из 10 выпускников работают в топовых технологических компаниях, а каждый четвёртый идёт в науку (типа меня).
Учиться в ШАДе можно как очно, так и удаленно.
Кстати, сейчас там преподает Елена Войта, которая работает ресерчером в Meta AI и ведет курс по NLP.
Подать заявку можно до 12 мая. Сайт ШАДа.
@ai_newz
❤118🔥48😍13🫡10👍6😁5🦄5😱2❤🔥1💯1
Помните, всего пару недель назад я писал о проекте финансирования конгрессом США суперкомпьютера "для народа" в противовес big-tech? Вот и Канада инвестирует в этом году полтора миллиарда долларов США в создание своего AI кластера. Этого хватит на десяток-другой тысяч GPU, что прилично, но и близко не стоит с инвестициями Meta, не говоря уже о планах Microsoft.
Занятно, что одной из причин, почему Канада инвестирует в AI – это то, что миллениалы и Gen Z расстраиваются, что у них нет возможности быстро разбогатеть, как это было у бумеров:
Работа в AI = ПРИБЫЛЬНОЕ ДЕЛО.
Кроме финансирования суперкомпьютера (куда уходит 85% денег), в законопроекте есть деньги для стартапов, программы для адаптации к AI и бюджет для создания AI safety института (надеюсь он будет заниматься mechanistic interpretability, а не написанием думерских фанфиков).
Страны, такие как Британия ещё год назад, начали просыпаться к AI-лихорадке, но пока что воспринимают это как небольшое хобби. До каких масштабов могут вырасти национальные AI бюджеты если они воспримут это всерьёз?
@ai_newz
Занятно, что одной из причин, почему Канада инвестирует в AI – это то, что миллениалы и Gen Z расстраиваются, что у них нет возможности быстро разбогатеть, как это было у бумеров:
For Millennials and Gen Z, who feel their hard work isn’t paying off like it did for previous generations, we must invest in good-paying opportunities that help them get ahead.
Работа в AI = ПРИБЫЛЬНОЕ ДЕЛО.
Кроме финансирования суперкомпьютера (куда уходит 85% денег), в законопроекте есть деньги для стартапов, программы для адаптации к AI и бюджет для создания AI safety института (надеюсь он будет заниматься mechanistic interpretability, а не написанием думерских фанфиков).
Страны, такие как Британия ещё год назад, начали просыпаться к AI-лихорадке, но пока что воспринимают это как небольшое хобби. До каких масштабов могут вырасти национальные AI бюджеты если они воспримут это всерьёз?
@ai_newz
❤52🔥21👍15😁6🤯3⚡2🦄1
Нейродайджест за неделю (#12)
1. Туториалы
- Mixture of Experts - введение в технологию MoE, маст хэв в топовых LLM.
- Туториал по свежей text2music модели Suno v3 - о том как выжать из суно максимум, а еще запилить клип.
- Интро в Трансформеры для чайников - серия видео от 3Blue1Brown, доступно (ну прям совсем) объясняющая принцип работы трансформеров.
- Tutorial on Diffusion Models for Imaging and Vision - VAE, DDPM, Score-Matching Langevin Dynamics и стохастическим диффурам. База по диффузии для среднячков.
2. Релизы
- Gaussian Head Avatar - гипер-реалистичные 3D аватары на основе Гауссовских сплатов и нейронного рендеринга.
- Higgsfield AI - новый игрок на поле генерации видео. Где-то между Runway Gen-2 и Sora.
- Stable Audio 2 - text2music, но без пиратского контента в датасетах, если не хочешь рисковать
- Command R+ – прекрасная open sourse LLM для которой не нужен супер компьютер (но 2x3090)
3. Новости
- Землетрясение в Тайване и его влияние на производство чипов. Как природные катаклизмы влияют на индустрию AI.
- Выбесить LLM или новый метод "many-shot jailbreaking" для обхода фильтров безопасности моделей с длинным контекстом.
- Siri учится видеть - Apple о модели ReALM для чтения экрана.
4. Личное
- Собеседования в Meta: Про то, какие собеседования я провожу, и про то, как я записался на обучение вести новые типы интервью.
#дайджест
@ai_newz
1. Туториалы
- Mixture of Experts - введение в технологию MoE, маст хэв в топовых LLM.
- Туториал по свежей text2music модели Suno v3 - о том как выжать из суно максимум, а еще запилить клип.
- Интро в Трансформеры для чайников - серия видео от 3Blue1Brown, доступно (ну прям совсем) объясняющая принцип работы трансформеров.
- Tutorial on Diffusion Models for Imaging and Vision - VAE, DDPM, Score-Matching Langevin Dynamics и стохастическим диффурам. База по диффузии для среднячков.
2. Релизы
- Gaussian Head Avatar - гипер-реалистичные 3D аватары на основе Гауссовских сплатов и нейронного рендеринга.
- Higgsfield AI - новый игрок на поле генерации видео. Где-то между Runway Gen-2 и Sora.
- Stable Audio 2 - text2music, но без пиратского контента в датасетах, если не хочешь рисковать
- Command R+ – прекрасная open sourse LLM для которой не нужен супер компьютер (но 2x3090)
3. Новости
- Землетрясение в Тайване и его влияние на производство чипов. Как природные катаклизмы влияют на индустрию AI.
- Выбесить LLM или новый метод "many-shot jailbreaking" для обхода фильтров безопасности моделей с длинным контекстом.
- Siri учится видеть - Apple о модели ReALM для чтения экрана.
4. Личное
- Собеседования в Meta: Про то, какие собеседования я провожу, и про то, как я записался на обучение вести новые типы интервью.
#дайджест
@ai_newz
🔥67👍16❤11❤🔥6⚡3
Какой может быть новая Siri?
Вышел пейпер от Apple про их новую модель ReALM. Я недавно писал про то, как Bloomberg пытались тренировать свою модель, и то, как у них это не получилось. Но Apple доказали, что при грамотном тюнинге даже ну ооочень маленькой моделью в 80М можно догнать или даже обогнать флагманские LLM а определенных задачах.
Так вот, новая Siri обещает очень ловко справляться с UI. А учитывая тот факт, что Apple – это крупнейшая экосистема, то у Siri будет доступ ко всему, что вам может понадобиться. От голосового управления календарём до составления плейлистов в iTunes (но пока это все фантазии).
Вообще, в статье описывается интересный метод для взаимодействия LLM с UI. На вход принимаются скриншоты, и с них в тупую собирается весь текст. Далее текст идет на анализ в LLM, и та, основываясь на инпуте юзера и тексте с экрана, решает, что делать и как отвечать.
Пока нет прямого управления UI, чтобы агент прям сам запускал какую-то работу в приложении. В статье пока только примеры того, как модель собирает информацию с экрана и выводит релевантный ответ. Например, собирает адреса с сайта, который сейчас на экране. Суть в том, что потом это можно будет использовать для таких запросов, типа: "Напиши второму в этом списке контактов, что созвон в 14:00". Пока они учат понимать, что происходит на экране.
Очень жду крутые анонсы WWDC в июне!
Пейпер
@ai_newz
Вышел пейпер от Apple про их новую модель ReALM. Я недавно писал про то, как Bloomberg пытались тренировать свою модель, и то, как у них это не получилось. Но Apple доказали, что при грамотном тюнинге даже ну ооочень маленькой моделью в 80М можно догнать или даже обогнать флагманские LLM а определенных задачах.
Так вот, новая Siri обещает очень ловко справляться с UI. А учитывая тот факт, что Apple – это крупнейшая экосистема, то у Siri будет доступ ко всему, что вам может понадобиться. От голосового управления календарём до составления плейлистов в iTunes (но пока это все фантазии).
Вообще, в статье описывается интересный метод для взаимодействия LLM с UI. На вход принимаются скриншоты, и с них в тупую собирается весь текст. Далее текст идет на анализ в LLM, и та, основываясь на инпуте юзера и тексте с экрана, решает, что делать и как отвечать.
Пока нет прямого управления UI, чтобы агент прям сам запускал какую-то работу в приложении. В статье пока только примеры того, как модель собирает информацию с экрана и выводит релевантный ответ. Например, собирает адреса с сайта, который сейчас на экране. Суть в том, что потом это можно будет использовать для таких запросов, типа: "Напиши второму в этом списке контактов, что созвон в 14:00". Пока они учат понимать, что происходит на экране.
Очень жду крутые анонсы WWDC в июне!
Пейпер
@ai_newz
🔥126👍37❤17🤯8🦄2😁1
Что такое Mixture of Experts (MoE)?
МоЕ — это вид моделей, который используется в куче современных LLM. Далеко ходить не надо — пять из шести моделей, о которых я рассказывал в дайджесте на прошлой неделе, были MoE. GPT-4, судя по слухам, подтверждённым Хуангом – тоже MoE.
Чем MoE отличаются от обычных (dense) моделей?
В MoE часть слоев заменяется на sparse (разреженные) MoE-слои. Они состоят из нескольких "экспертов" — по сути, отдельных небольших слоёв. Для каждого токена используется только небольшая часть экспертов. Решает, какие токены обрабатываются каким экспертами, специальная "сеть-маршрутизатор". Это позволяет MoE быть быстрее чем dense модели, как в тренировке так и в инференсе.
Почему MoE используют?
Модели с MoE учатся в разы быстрее обычных с таким же количеством компьюта. Авторы DBRX хвастались что их конфиг MoE учится в 2 раза быстрее их же dense модели, а у авторов Qwen-MoE прирост скорости был вообще 4x.
Откуда такая разница между разными MoE в приросте эффективности тренировки?
Когда учится MoE, нужно балансировать потребление памяти, эффективность тренировки и скорость выполнения, что достигается уменьшением или увеличением общего числа экспертов, числа активных экспертов и размера экспертов. Разные команды используют разные конфигурации, отсюда и разница.
Почему MoE не используют везде?
MoE потребляет в разы больше памяти чем обычные модели, что касается и обучения и инференса. На практике большее количество памяти означает большее количество видеокарт. Для запуска Grok, например, нужно 8 видеокарт. Для GPT-4, по слухам, нужно вообще 64 видеокарты. Чтобы это имело финансовый смысл, нужен определенный уровень нагрузки, который есть не у всех. Плюс тот факт, что модель - MoE, часто ставит крест на возможности запуска на потребительских видеокартах.
Как их запускают?
Модель разбивают на несколько видеокарт (например, с помощью tensor parallelism). На каждую видеокарту кидается одинаковое количество экспертов и используют трюки чтобы убедиться что на каждого приходится одинаковая нагрузка.
Как это выглядит применимо к трансформерам?
Обычно эксперты в MoE делаются на основе слоёв MLP внутри трансформера. То есть вместо одного MLP делают несколько параллельных, но одновременно используется только часть из них. Остальные части модели (attention, эмбеддинги) — общие для всех экспертов.
>> Блогпост про MoE с большим числом деталей
#ликбез
@ai_newz
МоЕ — это вид моделей, который используется в куче современных LLM. Далеко ходить не надо — пять из шести моделей, о которых я рассказывал в дайджесте на прошлой неделе, были MoE. GPT-4, судя по слухам, подтверждённым Хуангом – тоже MoE.
Чем MoE отличаются от обычных (dense) моделей?
В MoE часть слоев заменяется на sparse (разреженные) MoE-слои. Они состоят из нескольких "экспертов" — по сути, отдельных небольших слоёв. Для каждого токена используется только небольшая часть экспертов. Решает, какие токены обрабатываются каким экспертами, специальная "сеть-маршрутизатор". Это позволяет MoE быть быстрее чем dense модели, как в тренировке так и в инференсе.
Почему MoE используют?
Модели с MoE учатся в разы быстрее обычных с таким же количеством компьюта. Авторы DBRX хвастались что их конфиг MoE учится в 2 раза быстрее их же dense модели, а у авторов Qwen-MoE прирост скорости был вообще 4x.
Откуда такая разница между разными MoE в приросте эффективности тренировки?
Когда учится MoE, нужно балансировать потребление памяти, эффективность тренировки и скорость выполнения, что достигается уменьшением или увеличением общего числа экспертов, числа активных экспертов и размера экспертов. Разные команды используют разные конфигурации, отсюда и разница.
Почему MoE не используют везде?
MoE потребляет в разы больше памяти чем обычные модели, что касается и обучения и инференса. На практике большее количество памяти означает большее количество видеокарт. Для запуска Grok, например, нужно 8 видеокарт. Для GPT-4, по слухам, нужно вообще 64 видеокарты. Чтобы это имело финансовый смысл, нужен определенный уровень нагрузки, который есть не у всех. Плюс тот факт, что модель - MoE, часто ставит крест на возможности запуска на потребительских видеокартах.
Как их запускают?
Модель разбивают на несколько видеокарт (например, с помощью tensor parallelism). На каждую видеокарту кидается одинаковое количество экспертов и используют трюки чтобы убедиться что на каждого приходится одинаковая нагрузка.
Как это выглядит применимо к трансформерам?
Обычно эксперты в MoE делаются на основе слоёв MLP внутри трансформера. То есть вместо одного MLP делают несколько параллельных, но одновременно используется только часть из них. Остальные части модели (attention, эмбеддинги) — общие для всех экспертов.
>> Блогпост про MoE с большим числом деталей
#ликбез
@ai_newz
👍137🔥29❤20❤🔥7
Loading…
