Google DeepMind пусна EmbeddingGemma 2 — 740M отворен мултимодален модел за ембединг, изграден върху Gemma 4
EmbeddingGemma 2 на Google DeepMind картографира 5 типа входове в едно 768-мерно пространство и е достъпен от днес по Apache 2.0.
242 новини · всички източници
EmbeddingGemma 2 на Google DeepMind картографира 5 типа входове в едно 768-мерно пространство и е достъпен от днес по Apache 2.0.
Mistral AI представи Mistral Large 4, с прякор Le Chonk, като публична предварителна версия. Това е Mixture of Experts модел с 1,05 трилиона параметъра и 49 милиарда активни параметъра, с вградено въвеждане на изображения и контекстен прозорец от 1 милион токена, обучен…
Reka представи Rho-1 — омни-модел за разсъждение с 19B параметъра, обучен от нулата. Една мрежа чете и генерира текст, изображения, видео и действия за роботи чрез споделен KV кеш. Дестилиран вариант връща 5,3-секунден клип за около секунда. Той е…
JEPA-Anything разделя единичната латентна цел на JEPA на 4 ортогонални фактора, всеки със собствен предиктор. Тестван в 7 области, моделът надмина съпоставимите базови модели JEPA във всичките 10 задачи за динамика и намали грешката при интервенция в Interventional Pong с 34,8%.
Together AI пусна Together Link — безплатен CLI с лиценз MIT, който свързва Claude Code, Codex, OpenCode, Pi и настолните приложения Claude и ChatGPT с отворени модели като Kimi K3 и GLM 5.3. Една команда за инсталиране го настройва, а…
Научете как да изградите цялостен потоков конвейер за обучение на роботи с набора от данни NVIDIA Cosmos3-DROID без локално изтегляне, като използвате четене на Parquet по диапазони от байтове, клониране на поведението и времево ансамблиране.
Reflection AI представи Beam, първия си модел с отворени тегла. Това е разреден Mixture-of-Experts модел с 501 млрд. параметъра, от които 23 млрд. активни, създаден за програмиране и работа с ИИ агенти. Според Reflection той достига нивото на GLM-5.2 при разсъждение, като изисква 3–4 пъти по-малко изчислителни ресурси за инференция…
Един трансформър извърши генерирането на кандидати и класирането в A/B тест на Yandex Music без ръчно конструирани признаци, като увеличи харесванията с 11,42%.
Qwen на Alibaba премина от чатбот с достъп само с покана през април 2023 г. до модел с отворени тегла с 2,4 трилиона параметъра през август 2026 г. Това е пълната история, издание по издание: всеки основен модел, ключовата му характеристика и как се е променил лицензът му. Към всяко твърдение има връзка…
Cantina Security, съвместно с Yeta Labs, пусна apex-flash-1 — модел с отворени тегла, обучен специално за изследване на уязвимости. Това е донастройка чрез обучение с подкрепление на GLM-5.3-Flash на Z.ai, публикувана в Hugging Face под лиценза MIT. Може ли да бъде внедрен? Да, теглата по лиценза MIT…
Astra води в работата с компютър, Argon — в правните и финансовите задачи, а Sol печели по цена за агенти за програмиране.
Google Research представи система за федеративно обучение, която пренася изчисляването на градиентите от телефоните в атестирани TEE на сървърите. Политиките за достъп се публикуват в журнала Rekor на Sigstore, а двоичните файлове могат да се изграждат възпроизводимо, така че централизираната диференциална поверителност да може да се проверява външно.