Google выпустили Gemini 3.6 Flash и Gemini 3.5 Flash Lite
Это минорные апдейты, Flash теперь использует чуть меньше токенов и немного дешевле за токен, $7.5 за миллион токенов на выход вместо $9. В итоге модель немного дешевле, но всё равно остаётся довольно дорогой.
На 3.5 Flash Lite цены наоборот повысили, теперь миллион токенов на выход стоит $2.5, вместо $1.5. Токены на вход стоят теперь $0.3 за миллион токенов любого типа, вместо $0.5 за аудио и $0.25 за все другие типы. Модель стала умнее, но цена за таск по замерам Artificial Analysis выросла в два раза, с $0.04 до $0.09 за таск.
Где-то в недрах гугла плачет Gemini 3.5 Pro
@ai_newz
Это минорные апдейты, Flash теперь использует чуть меньше токенов и немного дешевле за токен, $7.5 за миллион токенов на выход вместо $9. В итоге модель немного дешевле, но всё равно остаётся довольно дорогой.
На 3.5 Flash Lite цены наоборот повысили, теперь миллион токенов на выход стоит $2.5, вместо $1.5. Токены на вход стоят теперь $0.3 за миллион токенов любого типа, вместо $0.5 за аудио и $0.25 за все другие типы. Модель стала умнее, но цена за таск по замерам Artificial Analysis выросла в два раза, с $0.04 до $0.09 за таск.
Где-то в недрах гугла плачет Gemini 3.5 Pro
@ai_newz
😁137❤22👍16💯5🔥3
Нейродайджест за неделю (#123)
LLM
- Fable 5 — Anthropic оставляет топовую модель в подписках Max и Team Premium. Пользователям Pro и Team разово выдадут $100 кредитов.
- Kimi K3 — Moonshot выпустили новый претрейн на 2,8 трлн параметров, обгоняющий Opus 4.8. Доступен в API, веса откроют до 27 июля.
- T-Search — экономный агентнвй ретривер на базе Qwen3.6. MoE-модель умещается на одной GPU и обходит открытые гиганты вроде Qwen3.5-397B.
- GigaChat Audio — опенсорс мультиязычный стек для распознавания речи GigaAM Multilingual и audio-native LLM с окном контекста до 2 часов.
Генеративные модели
- Слив Suno — Масштабная утечка исходников подтвердила использование миллионов треков с YouTube Music и других площадок для обучения генератора.
- MIRA — World model с мультиплеером от kyutai и Epic Games. Это нейронная версия Rocket League, поддерживающая 4 игроков или бесконечную игру самой с собой.
Прочее
- Клавиатура для вайбкодинга — OpenAI выпустили девайс в магазине мерча за $230. В комплекте кнопка «принять изменения», регулятор ризонинга и кастомные кейкапы.
> Читать дайджест #122
#дайджест
@ai_newz
LLM
- Fable 5 — Anthropic оставляет топовую модель в подписках Max и Team Premium. Пользователям Pro и Team разово выдадут $100 кредитов.
- Kimi K3 — Moonshot выпустили новый претрейн на 2,8 трлн параметров, обгоняющий Opus 4.8. Доступен в API, веса откроют до 27 июля.
- T-Search — экономный агентнвй ретривер на базе Qwen3.6. MoE-модель умещается на одной GPU и обходит открытые гиганты вроде Qwen3.5-397B.
- GigaChat Audio — опенсорс мультиязычный стек для распознавания речи GigaAM Multilingual и audio-native LLM с окном контекста до 2 часов.
Генеративные модели
- Слив Suno — Масштабная утечка исходников подтвердила использование миллионов треков с YouTube Music и других площадок для обучения генератора.
- MIRA — World model с мультиплеером от kyutai и Epic Games. Это нейронная версия Rocket League, поддерживающая 4 игроков или бесконечную игру самой с собой.
Прочее
- Клавиатура для вайбкодинга — OpenAI выпустили девайс в магазине мерча за $230. В комплекте кнопка «принять изменения», регулятор ризонинга и кастомные кейкапы.
> Читать дайджест #122
#дайджест
@ai_newz
3❤36👍22💔2🔥1
Anthropic оставляют Fable 5 в подписке
С 20 июля модель будет включена в планах Max ($100/$200) и Team Premium ($125), на них Fable по прежнему можно будет использовать до половины лимитов. Планам Pro и Team разово выдадут по $100 кредитов.
В целом, как и ожидалось. Вот что конкуренция делает с людьми.😁
Я так привык к Fable, что уже неохотно переключаюсь на Opus.
@ai_newz
С 20 июля модель будет включена в планах Max ($100/$200) и Team Premium ($125), на них Fable по прежнему можно будет использовать до половины лимитов. Планам Pro и Team разово выдадут по $100 кредитов.
В целом, как и ожидалось. Вот что конкуренция делает с людьми.😁
Я так привык к Fable, что уже неохотно переключаюсь на Opus.
@ai_newz
3😁459🔥62👍27❤21🫡8🦄3💔2
Ищу Webflow-разработчика на креативный лендинг
Я для GenPeach AI ищу Webflow-разработчика, который сможет разработать лендинг примерно из семи блоков. Сайт уже существует на Webflow — поменяются контент, лейаут блоков и часть дизайн-элементов и анимаций. Новый дизайн предоставлю в формате макета в фигме.
Нужен синьорный специалист с опытом (3+ года) разработки креативных сайтов на Webflow с интерактивными элементами или анимацией и вниманием к деталям.
Требования к кандидату:
– Очень внимательный к деталям (отступы, цвета и т.д.)
– Быстро выполняет задачи
– Максимально прозрачен и быстро общается
– Ответственный (Всегда соблюдает договорённости и сроки)
– "Get shit done" mentality (don't bother me with issues, but with specific solutions)
Пара важных моментов:
– Вы должны иметь возможность принимать оплату на карту иностранного банка (вы живёте за пределами России и Беларуси).
– Availability: конец июля / ~начало августа.
Если это про вас, заполните вот эту небольшую анкету.
По вопросам можно писать на hr@genpeach.ai
Но перед тем, как задавать вопросы - заполните анкету.
@ai_newz
Я для GenPeach AI ищу Webflow-разработчика, который сможет разработать лендинг примерно из семи блоков. Сайт уже существует на Webflow — поменяются контент, лейаут блоков и часть дизайн-элементов и анимаций. Новый дизайн предоставлю в формате макета в фигме.
Нужен синьорный специалист с опытом (3+ года) разработки креативных сайтов на Webflow с интерактивными элементами или анимацией и вниманием к деталям.
Требования к кандидату:
– Очень внимательный к деталям (отступы, цвета и т.д.)
– Быстро выполняет задачи
– Максимально прозрачен и быстро общается
– Ответственный (Всегда соблюдает договорённости и сроки)
– "Get shit done" mentality (don't bother me with issues, but with specific solutions)
Пара важных моментов:
– Вы должны иметь возможность принимать оплату на карту иностранного банка (вы живёте за пределами России и Беларуси).
– Availability: конец июля / ~начало августа.
Если это про вас, заполните вот эту небольшую анкету.
По вопросам можно писать на hr@genpeach.ai
Но перед тем, как задавать вопросы - заполните анкету.
@ai_newz
Google Docs
Website Webflow Developer
7😁138❤27💔8🔥4🦄4👍3🤯2
Слив Suno
Хакер под ником ellie.191 слил старые исходники Suno, и это подтвердило то, о чем все и так догадывались. Модель обучали, соскрэпив миллионы (а скорее всего десятки миллионов) треков и текстов с YouTube Music, Deezer, Genius, Pond5, Jamendo, Freesound и IMSLP. В слитых данных засветились исходники за 2023–2024 годы и скрипты для скрейпинга.
Только с YouTube Music стащили больше 2 миллионов клипов. Причем разработчики специально выкачивали акапеллы, чтобы получить чистый вокал для обучения. Для обхода защит ютуба Suno юзали сторонний сервис Bright Data, а в планах было выкачать миллион часов подкастов через PodcastIndex.
Suno защищаются тем, что тренировать модели на копирайтных материалах, которые публично доступны в интернеты - это fair use (есть такое понятие в США).
Утечка произошла еще в ноябре 2025-го, но компания технично умолчала об этом. Под шумок утекли и данные клиентов: email, номера телефонов и платежная информация из Stripe. Suno оправдываются тем, что полных номеров карт у них не было, поэтому уведомлять пользователей по закону они были не обязаны.
Сейчас RIAA (Американская ассоциация звукозаписывающих компаний) как раз судится с Suno за нарушение копирайта, и этот слив для них настоящий подарок.
Статья на The Verge
@ai_newz
Хакер под ником ellie.191 слил старые исходники Suno, и это подтвердило то, о чем все и так догадывались. Модель обучали, соскрэпив миллионы (а скорее всего десятки миллионов) треков и текстов с YouTube Music, Deezer, Genius, Pond5, Jamendo, Freesound и IMSLP. В слитых данных засветились исходники за 2023–2024 годы и скрипты для скрейпинга.
Только с YouTube Music стащили больше 2 миллионов клипов. Причем разработчики специально выкачивали акапеллы, чтобы получить чистый вокал для обучения. Для обхода защит ютуба Suno юзали сторонний сервис Bright Data, а в планах было выкачать миллион часов подкастов через PodcastIndex.
Suno защищаются тем, что тренировать модели на копирайтных материалах, которые публично доступны в интернеты - это fair use (есть такое понятие в США).
Утечка произошла еще в ноябре 2025-го, но компания технично умолчала об этом. Под шумок утекли и данные клиентов: email, номера телефонов и платежная информация из Stripe. Suno оправдываются тем, что полных номеров карт у них не было, поэтому уведомлять пользователей по закону они были не обязаны.
Сейчас RIAA (Американская ассоциация звукозаписывающих компаний) как раз судится с Suno за нарушение копирайта, и этот слив для них настоящий подарок.
Статья на The Verge
@ai_newz
😁216👍39❤🔥23❤19🤯13🔥6😍4🦄1
Команда T-Tech выложила в открытый доступ T-Search — агентного ретривера для многошагового поиска на английском и русском, построенного на Qwen3.6-35B-A3B. Главная ценность — экономика: MoE-модель с ~3B активных параметров умещается на одной GPU, тогда как сопоставимое качество раньше требовало кластеров из 16 карт. При этом по среднему Recall@10 T-Search обходит куда более крупные открытые модели — Qwen3.5-397B, GLM-5.2, Kimi-K2.6. Инференс поисковой агентики дешевеет на порядок, а качество только растёт.
Ускоряет поиск и само устройство агента: он работает раундами, перенося между ними лишь компактную «память» вместо полной истории, что удерживает контекст в рамках ~32K токенов. Бюджетом можно управлять гибко: быстрый дешёвый поиск — или три параллельных роллаута с RRF-слиянием, поднимающие средний Recall@10 с 55.96 до 61.33. Модель, харнесс и датасеты выложены под Apache 2.0.
Коллекция на 🤗
@ai_newz
Ускоряет поиск и само устройство агента: он работает раундами, перенося между ними лишь компактную «память» вместо полной истории, что удерживает контекст в рамках ~32K токенов. Бюджетом можно управлять гибко: быстрый дешёвый поиск — или три параллельных роллаута с RRF-слиянием, поднимающие средний Recall@10 с 55.96 до 61.33. Модель, харнесс и датасеты выложены под Apache 2.0.
Коллекция на 🤗
@ai_newz
1🔥132👍66❤41😁30🫡7🦄4
Moonshot выпустили Kimi K3
Новый претрейн на 2,8 триллиона параметров, обгоняет Opus 4.8 по бенчам, но не дотягивает до Fable и Sol. Уже доступна в API, чате и кодинг подписке.
Если бы они ее выпустили на месяцок раньше, то она могла бы побыть самой мощной моделью. Ну, а сейчас, если верить бенчам, то это самая умная открытая модель.
Стоит модель как Sonnet, $3/$15 за миллион токенов, кэширование автоматическое, на закэшированные токены 90% скидка. При этом она использует меньше токенов, а стоимость на таск в два раза меньше чем у Opus 4.8. Веса обещают релизнуть до 27 июля.
https://www.kimi.com/blog/kimi-k3
@ai_newz
Новый претрейн на 2,8 триллиона параметров, обгоняет Opus 4.8 по бенчам, но не дотягивает до Fable и Sol. Уже доступна в API, чате и кодинг подписке.
Если бы они ее выпустили на месяцок раньше, то она могла бы побыть самой мощной моделью. Ну, а сейчас, если верить бенчам, то это самая умная открытая модель.
Стоит модель как Sonnet, $3/$15 за миллион токенов, кэширование автоматическое, на закэшированные токены 90% скидка. При этом она использует меньше токенов, а стоимость на таск в два раза меньше чем у Opus 4.8. Веса обещают релизнуть до 27 июля.
https://www.kimi.com/blog/kimi-k3
@ai_newz
2🔥285❤47👍40😱12😁5💔3❤🔥1
Media is too big
VIEW IN TELEGRAM
OpenAI выпустили клавиатуру для вайбкодинга
Кроме кнопки "принять изменения" на ней есть ещё дюжина других клавиш, микрофон, регулятор уровня ризонинга и стик для выбора скилов. Свичи низкопрофильные, на выбор есть кликающие и тихие, в комплекте также идёт 32 кастомных кикапа на разные случаи жизни. Стоит это чудо 230 долларов и продаётся в магазине мерча OpenAI.
@ai_newz
Кроме кнопки "принять изменения" на ней есть ещё дюжина других клавиш, микрофон, регулятор уровня ризонинга и стик для выбора скилов. Свичи низкопрофильные, на выбор есть кликающие и тихие, в комплекте также идёт 32 кастомных кикапа на разные случаи жизни. Стоит это чудо 230 долларов и продаётся в магазине мерча OpenAI.
@ai_newz
😁412🦄46❤37🔥14🤯7😱6🫡3❤🔥2👍2😍1
This media is not supported in your browser
VIEW IN TELEGRAM
MIRA — world model с мультиплеером
Французский стартап kyutai заколлабился с Epic Games и сделал нейронную версию игры Rocket League. Она позволяет иметь мультиплеерную сессию с 4 игроками, каждый из которых может управляться либо самой моделью либо человеком. Генерация нескольких точек зрения одновременно сильно повысила стабильность модели по сравнению с генерацией всего одной, модель может играть сама с собой без артефактов практически бесконечно (создатели запускали модель на сутки, при окне контекста в 4 секунды).
Натренировали это на 10к часов геймплея ботов, заметную часть датасета выложили в открытый доступ. Код для тренировки модели тоже доступен.
Демка
Пейпер
Код
@ai_newz
Французский стартап kyutai заколлабился с Epic Games и сделал нейронную версию игры Rocket League. Она позволяет иметь мультиплеерную сессию с 4 игроками, каждый из которых может управляться либо самой моделью либо человеком. Генерация нескольких точек зрения одновременно сильно повысила стабильность модели по сравнению с генерацией всего одной, модель может играть сама с собой без артефактов практически бесконечно (создатели запускали модель на сутки, при окне контекста в 4 секунды).
Натренировали это на 10к часов геймплея ботов, заметную часть датасета выложили в открытый доступ. Код для тренировки модели тоже доступен.
Демка
Пейпер
Код
@ai_newz
🔥134❤27👍18🤯11🦄5⚡2🤩2
Сбер выкатил в опенсорс GigaAM Multilingual и GigaChat Audio
Статьи по архитектуре моделей уже приняли на Interspeech 2026. В релизах исправили две проблемы открытых Speech AI систем — слабую поддержку языков СНГ и деградацию качества на длинных аудио.
GigaAM Multilingual — мультиязычный стек для распознавания русского, казахского, киргизского, узбекского и английского. Тут две части: аудио-энкодер и CTC ASR. Энкодер обучали на 2 млн часов речи на 70+ языках, и он быстро адаптируется к новым доменам. На башкирском и грузинском его дообучили с одного датасета Common Voice до ошибки WER ~4% (у Whisper Encoder при тех же вводных — 11%+). А модель распознавания CTC ASR в версии на 240M параметров обходит Whisper Large v3 и Omnilingual 1B, хотя весит кратно меньше.
GigaChat Audio — это audio-native LLM на базе GigaAM Multilingual и GigaChat3.1-10B-A1.8B. Модель тянет до 2 часов контекста и умеет в temporal grounding — локализацию событий во времени с таймстемпами и суммаризацией интервалов. На длинных записях от 20 до 60 минут точность локализации IoU составляет 48.3, в то время как у Voxtral, Phi-4 и Qwen3-Omni результат близок к нулю. Вдобавок опубликовали датасет TimeGround-1M для обучения LLM привязке событий ко времени, а на RuBQ-Audio модель выбивает 60.0 (против 43.7 у Qwen3-Omni).
Полноразмерную GigaChat-Max-Audio уже добавили в ИИ-помощник ГигаЧат giga.chat, а распознавание голосовых сообщений работает в @smartspeech_sber_bot. Веса открытых моделей, датасет и статьи на arXiv уже в сети.
GigaAM Multilingual
GigaChat Audio
@ai_newz
Статьи по архитектуре моделей уже приняли на Interspeech 2026. В релизах исправили две проблемы открытых Speech AI систем — слабую поддержку языков СНГ и деградацию качества на длинных аудио.
GigaAM Multilingual — мультиязычный стек для распознавания русского, казахского, киргизского, узбекского и английского. Тут две части: аудио-энкодер и CTC ASR. Энкодер обучали на 2 млн часов речи на 70+ языках, и он быстро адаптируется к новым доменам. На башкирском и грузинском его дообучили с одного датасета Common Voice до ошибки WER ~4% (у Whisper Encoder при тех же вводных — 11%+). А модель распознавания CTC ASR в версии на 240M параметров обходит Whisper Large v3 и Omnilingual 1B, хотя весит кратно меньше.
GigaChat Audio — это audio-native LLM на базе GigaAM Multilingual и GigaChat3.1-10B-A1.8B. Модель тянет до 2 часов контекста и умеет в temporal grounding — локализацию событий во времени с таймстемпами и суммаризацией интервалов. На длинных записях от 20 до 60 минут точность локализации IoU составляет 48.3, в то время как у Voxtral, Phi-4 и Qwen3-Omni результат близок к нулю. Вдобавок опубликовали датасет TimeGround-1M для обучения LLM привязке событий ко времени, а на RuBQ-Audio модель выбивает 60.0 (против 43.7 у Qwen3-Omni).
Полноразмерную GigaChat-Max-Audio уже добавили в ИИ-помощник ГигаЧат giga.chat, а распознавание голосовых сообщений работает в @smartspeech_sber_bot. Веса открытых моделей, датасет и статьи на arXiv уже в сети.
GigaAM Multilingual
GigaChat Audio
@ai_newz
2❤257👍101😁76🔥25🫡10❤🔥9🦄6😱3🤩2
Нейродайджест за две недели (#122)
LLM
- LongCat 2.0 — Первая большая LLM на китайских чипах. Meituan выкатили модель на 1.6T параметров, обученную на 50 тысячах ускорителей типа Huawei Ascend. Эмбеддинги занимают 10% весов, а контекст достигает миллиона токенов.
- Claude Sonnet 5 — По перформансу модель подтянулась к Opus 4.8. Доступ открыли всем, включая бесплатных пользователей, а на API до конца лета действует промо-прайс.
- Снятие ограничений с Anthropic — Эпичная развязка истории с блокировкой Fable 5. В детальном разборе инцидента подтвердилось, что модель нашла уязвимость в Amazon и написала под неё эксплоит. Теперь запросы фильтрует жёсткий классификатор, а доступ к модели полностью вернули.
- Muse Spark 1.1 — Meta обновила модель с сильным упором на агентный кодинг и выкатила собственный API, выдавая $20 кредитов новым аккаунтам.
- Grok 4.5 — SpaceXAI , при помощи Cursor, дотренировали свою модель на полтора триллиона параметров. Вышло неплохо, модель стоит всего $2/$6 за миллион токенов при небольших контекстах, лишь немногим больше GPT 5.6 Luna.
- GPT 5.6 — Sol стала доступна платным юзерам, Terra и Luna — бесплатным. Вдогонку запустили агента ChatGPT Work, публикацию мини-сайтов и объединили Codex с ChatGPT на десктопе.
- Продление доступа к Fable по подписке — Anthropic почувствовали конкуренцию с OpenAI и решили оставить Fable по подписке ещё на неделю.
Генеративные модели
- Comfy MCP — Благодаря интеграции с MCP больше не нужно тонуть в спагетти-пайплайнах: ИИ-агент сам найдёт нужные ноды и соберёт любой воркфлоу.
- Muse Image и Muse Video — гибридные модели от Meta для генерации визуала. Muse Image сама пишет код для точной вставки графики, верстает на HTML и сама исправляет косяки.
Прочее
- Штраф для Google — Компания окончательно проиграла апелляцию в ЕС на $4.68 млрд за принудительную предустановку Search и Chrome на Android.
> Читать дайджест #121
#дайджест
@ai_newz
LLM
- LongCat 2.0 — Первая большая LLM на китайских чипах. Meituan выкатили модель на 1.6T параметров, обученную на 50 тысячах ускорителей типа Huawei Ascend. Эмбеддинги занимают 10% весов, а контекст достигает миллиона токенов.
- Claude Sonnet 5 — По перформансу модель подтянулась к Opus 4.8. Доступ открыли всем, включая бесплатных пользователей, а на API до конца лета действует промо-прайс.
- Снятие ограничений с Anthropic — Эпичная развязка истории с блокировкой Fable 5. В детальном разборе инцидента подтвердилось, что модель нашла уязвимость в Amazon и написала под неё эксплоит. Теперь запросы фильтрует жёсткий классификатор, а доступ к модели полностью вернули.
- Muse Spark 1.1 — Meta обновила модель с сильным упором на агентный кодинг и выкатила собственный API, выдавая $20 кредитов новым аккаунтам.
- Grok 4.5 — SpaceXAI , при помощи Cursor, дотренировали свою модель на полтора триллиона параметров. Вышло неплохо, модель стоит всего $2/$6 за миллион токенов при небольших контекстах, лишь немногим больше GPT 5.6 Luna.
- GPT 5.6 — Sol стала доступна платным юзерам, Terra и Luna — бесплатным. Вдогонку запустили агента ChatGPT Work, публикацию мини-сайтов и объединили Codex с ChatGPT на десктопе.
- Продление доступа к Fable по подписке — Anthropic почувствовали конкуренцию с OpenAI и решили оставить Fable по подписке ещё на неделю.
Генеративные модели
- Comfy MCP — Благодаря интеграции с MCP больше не нужно тонуть в спагетти-пайплайнах: ИИ-агент сам найдёт нужные ноды и соберёт любой воркфлоу.
- Muse Image и Muse Video — гибридные модели от Meta для генерации визуала. Muse Image сама пишет код для точной вставки графики, верстает на HTML и сама исправляет косяки.
Прочее
- Штраф для Google — Компания окончательно проиграла апелляцию в ЕС на $4.68 млрд за принудительную предустановку Search и Chrome на Android.
> Читать дайджест #121
#дайджест
@ai_newz
1❤52👍20🔥14
This media is not supported in your browser
VIEW IN TELEGRAM
Muse Image и Muse Video - Новые генераторы от Мета
Это первый релиз после ренейма Meta GenAI в Meta Superintelligence lab. И своего рода преемник моделей Emu.
По сути это что-то типа GPT-Image/Nano Banana, где очень тесно интегрирована диффузионная модель и LLM (потенцаильно шаря часть слоев). Модель теперь сама пишет Python-код и парсит веб для референсов (что уже было у NB). Наверняка все работает на базе Muse.
Показали ,как модель сначала пишет код для генерации фрактала, а затем чётко вставляет его на картинку, полезно для инфографики, теперь модель сначала построить график в питоне по вашим данным а затем ставит его в картинку и для менюшек в ресторанах, где нужна чёткая верстка, которую модель может сделать на условном html. Еще Muse сама исправляет косяки на сгенерированных картинках (типа Test-Time-Scaling, где делается несколько генераций и выбирается лучшая). Причём последняя фича якобы эмерджентно вылезла прямо при RL-тренировке.
В общем ещё одна нанобана, но с большим (?) ризонингом. На t2i арене попала навторое трекье место, совсем на тоненького опередив NB2 и Reve-2, но вчера выпущенный Reve-2.1 уже опять обскакал Muse.
На Image Edit Arena - тоже второе место, слегка обогнал MAI-image-2.5 (куда как раз ушла часть моей бывшей команды из Меты, в которой я работал раньше). На других аренах модели пока нет.
Без скандала не обошлось. Кто-то посчитал, что будет хорошей идеей генерить лица юзеров инсты просто по @-тегу (опция включена по дефолту), что не все оценили. Такого я, если честно, от Марка не ожидал 😅.
Видео-модель пока без агентов, но уже уверенно сидит в топ-3 лидербордов, обойдя happyhorse от Alibaba.
Блогпост - папиру, я думаю, можно не ждать
Потыкать модель можно на арене, либо пока только в американской инсте - у Меты занимает вечность, чтобы что-то выкатить на Европу.
@ai_newz
Это первый релиз после ренейма Meta GenAI в Meta Superintelligence lab. И своего рода преемник моделей Emu.
По сути это что-то типа GPT-Image/Nano Banana, где очень тесно интегрирована диффузионная модель и LLM (потенцаильно шаря часть слоев). Модель теперь сама пишет Python-код и парсит веб для референсов (что уже было у NB). Наверняка все работает на базе Muse.
Показали ,как модель сначала пишет код для генерации фрактала, а затем чётко вставляет его на картинку, полезно для инфографики, теперь модель сначала построить график в питоне по вашим данным а затем ставит его в картинку и для менюшек в ресторанах, где нужна чёткая верстка, которую модель может сделать на условном html. Еще Muse сама исправляет косяки на сгенерированных картинках (типа Test-Time-Scaling, где делается несколько генераций и выбирается лучшая). Причём последняя фича якобы эмерджентно вылезла прямо при RL-тренировке.
В общем ещё одна нанобана, но с большим (?) ризонингом. На t2i арене попала на
На Image Edit Arena - тоже второе место, слегка обогнал MAI-image-2.5 (куда как раз ушла часть моей бывшей команды из Меты, в которой я работал раньше). На других аренах модели пока нет.
Без скандала не обошлось. Кто-то посчитал, что будет хорошей идеей генерить лица юзеров инсты просто по @-тегу (опция включена по дефолту), что не все оценили. Такого я, если честно, от Марка не ожидал 😅.
Видео-модель пока без агентов, но уже уверенно сидит в топ-3 лидербордов, обойдя happyhorse от Alibaba.
Блогпост - папиру, я думаю, можно не ждать
Потыкать модель можно на арене, либо пока только в американской инсте - у Меты занимает вечность, чтобы что-то выкатить на Европу.
@ai_newz
❤61🔥11😁10👍8🙏2⚡1
GPT 5.6 уже раскатывают на всех пользователей
Sol будет доступен всем платным пользователям, Terra и Luna бесплатным. Вмест с релизом модели релизнули ChatGPT Work — ответ Claude Cowork, агент в ChatGPT для не-кодинговых задач. Второй заметный релиз — ChatGPT Sites, возможность публиковать мелкие сайтики сделанные при помощи ChatGPT, такой себе "у нас есть артефакты дома". Ну и Codex и ChatGPT это теперь одно приложение на десктопе.
@ai_newz
Sol будет доступен всем платным пользователям, Terra и Luna бесплатным. Вмест с релизом модели релизнули ChatGPT Work — ответ Claude Cowork, агент в ChatGPT для не-кодинговых задач. Второй заметный релиз — ChatGPT Sites, возможность публиковать мелкие сайтики сделанные при помощи ChatGPT, такой себе "у нас есть артефакты дома". Ну и Codex и ChatGPT это теперь одно приложение на десктопе.
@ai_newz
2❤156👍66🔥31🤩3❤🔥2🫡2
Guided Star-Shaped Masked Diffusion
У masked diffusion LLM есть довольно тупая проблема: если токен уже размаскировался, всё, он заморожен. Ошиблась модель на раннем шаге — дальше она уже не исправляет ошибку, а пытается построить вокруг неё текст. Такие несогласованности особенно заметны при маленьком количестве шагов. Существующие методы перемаскирования дают модели шанс передумать, но требуют сотен шагов, что убивает главное преимущество диффузии — скорость.
Авторы из T-Tech, ВШЭ и Constructor University представили на ICML метод, в котором все зашумлённые состояния зависят только от чистого текста, но не друг от друга. На каждом шаге модель предсказывает полную чистую последовательность, а следующее состояние сэмплируется заново из неё, ничего не наследуя от текущего: любой токен можно вернуть в маску и переписать, причём дообучения это не требует. С нуля так генерировать нельзя — перемаскирование на ранних шагах разрушает несложившийся контекст, поэтому первые ~70% шагов черновик пишется обычным способом, и лишь потом включается режим правки. Куда именно править, указывает отдельный лёгкий предсказатель ошибок, обученный на промахах модели при генерации. Главный минус такого подхода — отсутствие возможности вставлять и удалять токены.
В результате, за 128 шагов метод обгоняет по качеству и разнообразию текста лучший из прежних подходов с бюджетом в 512 шагов, что позволяет генерировать почти втрое быстрее (3.4 против 9.2 секунды на H200). Предсказатель ошибок, обученный на веб-текстах, переносится на код, математику и новости без дообучения.
Пейпер
Код
@ai_newz
У masked diffusion LLM есть довольно тупая проблема: если токен уже размаскировался, всё, он заморожен. Ошиблась модель на раннем шаге — дальше она уже не исправляет ошибку, а пытается построить вокруг неё текст. Такие несогласованности особенно заметны при маленьком количестве шагов. Существующие методы перемаскирования дают модели шанс передумать, но требуют сотен шагов, что убивает главное преимущество диффузии — скорость.
Авторы из T-Tech, ВШЭ и Constructor University представили на ICML метод, в котором все зашумлённые состояния зависят только от чистого текста, но не друг от друга. На каждом шаге модель предсказывает полную чистую последовательность, а следующее состояние сэмплируется заново из неё, ничего не наследуя от текущего: любой токен можно вернуть в маску и переписать, причём дообучения это не требует. С нуля так генерировать нельзя — перемаскирование на ранних шагах разрушает несложившийся контекст, поэтому первые ~70% шагов черновик пишется обычным способом, и лишь потом включается режим правки. Куда именно править, указывает отдельный лёгкий предсказатель ошибок, обученный на промахах модели при генерации. Главный минус такого подхода — отсутствие возможности вставлять и удалять токены.
В результате, за 128 шагов метод обгоняет по качеству и разнообразию текста лучший из прежних подходов с бюджетом в 512 шагов, что позволяет генерировать почти втрое быстрее (3.4 против 9.2 секунды на H200). Предсказатель ошибок, обученный на веб-текстах, переносится на код, математику и новости без дообучения.
Пейпер
Код
@ai_newz
👍128🔥36😁18❤16💯1
Denis Sexy IT 🤖
Fable 5 оставили в Claude Code до 12го июля Это я что, зря всю ночь его гонял тратя лимиты вместо сна 👤 Видимо релиз 5.6 Sol совсем скоро
GPT 5.6 выйдет уже завтра
OpenAI пообещали релизнуть все три модели линейки в этот четверг, а пока что расширяют превью на компании за пределами США.
@ai_newz
OpenAI пообещали релизнуть все три модели линейки в этот четверг, а пока что расширяют превью на компании за пределами США.
@ai_newz
5👍164🔥76❤32🤩9😁8🦄5❤🔥1🙏1💔1
Forwarded from Denis Sexy IT 🤖
Fable 5 оставили в Claude Code до 12го июля
Это я что, зря всю ночь его гонял тратя лимиты вместо сна👤
Видимо релиз 5.6 Sol совсем скоро
Это я что, зря всю ночь его гонял тратя лимиты вместо сна
Видимо релиз 5.6 Sol совсем скоро
X (formerly Twitter)
Claude (@claudeai) on X
We're extending access to Claude Fable 5 on all paid plans through July 12.
3🔥107😁72👍16❤12💯8🤯3🤩1🦄1
Loading…
