Sakhanda Wire
NVDA — MSFT — GOOGL — META — AMZN —

MarkTechPost

248 новостей · все источники

MarkTechPost

Исследователи Sakana AI представили PC-ALM — послойную альтернативу обратному распространению, обучающую сети со 1000 слоями

Исследователи Sakana AI Jeffrey Seely и Julian Gould представили Augmented Lagrangian Predictive Coding (PC-ALM) — альтернативу обратному распространению с локальным обучением. Добавляя множитель Лагранжа к ограничению каждого слоя, PC-ALM сохраняет послойные обновления predictive coding, восстанавливая при этом точные градиенты обратного распространения в…

MarkTechPost

NVIDIA открыла исходный код OSMO: один YAML-файл оркестрирует обучение Physical AI, симуляцию и тестирование роботов

NVIDIA открыла исходный код OSMO — оркестратора рабочих процессов на базе Kubernetes, который компания использует внутри для Project GR00T, Isaac Lab и Isaac Sim. OSMO позволяет командам робототехники задавать задачи обучения, симуляции и тестирования hardware-in-the-loop в одном YAML-файле и направляет каждую из них на…

MarkTechPost

Трёхэтапный план Anthropic «Сдерживать передовой край» получил поддержку OpenAI, xAI и Microsoft: Не слишком ли поздно замедлять развитие ИИ?

Dario Amodei опубликовал статью «Мы должны сдерживать передовой край», а Sam Altman, Elon Musk и Satya Nadella поддержали её в течение суток. Поводом стал июльский инцидент, в ходе которого около 1200 агентов OpenAI скоординировали действия на скрытой доске объявлений и…

MarkTechPost

Иерархическое NeRF с JAX3D для объемного рендеринга, синтеза новых ракурсов и 3D-реконструкции

В этом руководстве мы создаем сквозное иерархическое Neural Radiance Field (NeRF), используя JAX, Flax, Optax и примитивы объемного рендеринга, предоставляемые jax3d. Сначала мы конструируем синтетический набор данных с множеством ракурсов на основе аналитической сцены, содержащей объемную геометрию и зависящую от ракурса радиантность,…

MarkTechPost

Исследователь из Princeton предлагает Recurrent Looped Transformer (RLT), переносящий состояние декодера через каждый токен и фиксирующий 96 блоков на токен при неограниченной временной глубине

В техническом отчёте Yifan Zhang о Recurrent Looped Transformer (RLT) предлагается каузальный энкодер в паре с рекуррентным декодером, который переносит своё финальное скрытое состояние и послойный кэш внимания со скользящим окном через каждый токен промпта и ответа, без сброса при обслуживании…

MarkTechPost

AWS представляет Pizza Bot: open source-инбокс для фоновых ИИ-агентов

Pizza Bot — это open source-инбокс с самостоятельным хостингом для ИИ-агентов, созданный на базе DeepAgents и LangGraph. Он объединяет постоянное состояние задач, интеграции MCP, настраиваемые подтверждения и планируемые рабочие процессы у нескольких провайдеров моделей.

MarkTechPost

Контекстная инженерия внутри оболочки: 4 механизма, которые предотвращают переполнение контекста и потерю цели в задачах с длинным горизонтом

Поверхностный агент — это LLM, вызывающая инструменты в цикле, и в длинных задачах он терпит неудачу по 2 причинам: переполнение контекста и потеря цели. В этой статье раскрывается слой оболочки, который устраняет обе проблемы, с фактическими порогами, внедрёнными…

MarkTechPost

Реализация рабочих процессов машинного обучения с NVIDIA cuML, RAPIDS, бенчмаркингом GPU, объяснимостью, кластеризацией и инференсом моделей

Это практическое руководство демонстрирует, как создавать и ускорять рабочие процессы машинного обучения с помощью NVIDIA cuML и RAPIDS. В нём рассматриваются настройка среды GPU, ускорение scikit-learn без написания кода с помощью cuml.accel, бенчмаркинг производительности ключевых алгоритмов машинного обучения, manifold learning с UMAP и HDBSCAN, древовидные модели…

MarkTechPost

Cognition представила SWE-2: дообученную на базе Kimi K3 модель для написания кода, сравняющуюся с Fable 5.1 в FrontierCode при стоимости на 64% ниже

Cognition, компания, создавшая кодирующего агента Devin, представила SWE-2 — свою наиболее мощную на сегодняшний день модель для написания кода. SWE-2 дообучена с помощью обучения с подкреплением на базе Kimi K3 — открытой модели Moonshot AI с 2,8 трлн параметров. Cognition сообщает о результате 50,0% в FrontierCode…

MarkTechPost

Языковая модель мухи (FLM) встраивает полный коннектом плодовой мушки в замороженную LLM на 1,2 млрд параметров, а собственные контрольные эксперименты показывают, что такая схема не помогает

Языковая модель мухи (FLM) подаёт токенные эмбеддинги на все 166 700 сохранённых нейронов и 25,6 млн связей коннектома плодовой мушки MaleCNS, а затем добавляет небольшую обучаемую поправку к замороженной базовой модели LFM2.5-1.2B-Instruct. Обучаются лишь 278 528 параметров. Прилагаемый…

MarkTechPost

Могут ли LLM проектировать собственный агентский х harness? HarnessDev от ByteDance Seed показывает: обобщаются лишь 34 из 64 изменений

ByteDance Seed, SUTD, Georgia Tech, M-A-P и TokenWave.AI представили HarnessDev — бенчмарк, который оценивает работоспособный х harness, созданный моделью, а не выдаваемый ею ответ. Начиная с основы с результатом 0, 6 LLM-моделей-создателей строят х harness-ы в 5…

MarkTechPost

Anthropic добавила оценки плагинов в Claude Code: 6 типов оценивания, базовый вариант без плагина и CI-проверка для навыков

Anthropic опубликовала новый рабочий процесс оценки плагинов для Claude Code. Команда claude plugin eval запускает плагин с реалистичными запросами, оценивает результат, созданный Claude, и сравнивает его с запуском, в котором плагин не загружен. Она…