Sakhanda Wire
NVDA — MSFT — GOOGL — META — AMZN —

MarkTechPost

246 новини · всички източници

MarkTechPost

MiniMax пуска MiniMax-Music3: музикален модел с отворени тегла, генериращ завършени петминутни песни от текст на песен и структурирано описание

MiniMax пусна MiniMax-Music3 — текстово-музикален модел с отворени тегла. При зададени текст на песен със секционни тагове и структурирано описание той генерира завършена песен с продължителност до пет минути на един проход като 32 kHz, 16-битов стерео WAV файл. Ето архитектурата,…

MarkTechPost

Разработване на цялостен конвейер за интелигентна обработка на документи с docTR за OCR, анализ на оформлението, KIE, бенчмаркинг и PDF файлове с възможност за търсене

Разработете цялостен конвейер за интелигентна обработка на документи с docTR, интегриращ OCR, анализ на оформлението и KIE за извличане, ориентирано към продукционна среда, и създаване на PDF файлове с възможност за търсене.

MarkTechPost

DeepSeek AI пусна DeepSeek Harness в предварителна версия за разработчици: MIT-лицензирана инфраструктура за агенти, в която всичко е плъгин

DeepSeek Harness v0.1 е MIT-лицензирана инфраструктура за агенти, в която всяка възможност е плъгин на Cordis. Четири режима на изпълнение, журнали на сесиите само с добавяне и маршрутизация на модели, независима от доставчика.

MarkTechPost

Дообучаване на LLM с извикване на инструменти: пълно ръководство с XYZ-Aquila-SFT и Qwen3

Реализирайте цялостен конвейер за дообучаване на езикови модели с извикване на инструменти. Ръководството обхваща анализ на траектории, структурирано извличане на извиквания към инструменти, изобразяване в съвместимия с Qwen ChatML формат и ефективна адаптация с LoRA чрез PyTorch.

MarkTechPost

Z.ai пуска GLM-5.3 без дообучаване на базовия модел: по-добър в сложното програмиране и задачите с дълъг хоризонт

Z.ai пусна GLM-5.3 на 14 август 2026 г. Моделът използва непроменена базова версия GLM-5.2 с 743 млрд. параметъра. Всеки отчетен напредък идва от мащабирано дообучаване: повече среди за задачи с дълъг хоризонт, повече типове среди и по-продължително обучение. Резултатът в Terminal-Bench 3.0 се повишава от 4,6 на 28,3, а DeepSWE…

MarkTechPost

Представяме Needle 2: отворен модел с 45 млн. параметъра за извикване на инструменти, който се доставя като 14 MB бинарен файл и изпълнява цяла сесия в 28 MB RAM

Cactus Compute пусна Needle 2 — отворен модел с 45 млн. параметъра за извикване на инструменти, използване на устройства и структурирано извличане. Пълният модел е един-единствен 14 MB бинарен файл, който изпълнява сесия с около 28 MB RAM. Води и в двата сплита на Seal-Tools, като…

MarkTechPost

Създаване на LLM, фокусиран върху разсъжденията: Практическо ръководство за поточно извличане, подбор и дообучаване на корпуса за разсъждения SupraLabs

Този урок представя цялостен работен процес за създаване на компактен езиков модел, фокусиран върху разсъжденията. Като извличаме поточно корпуса за разсъждения SupraLabs от Hugging Face, прилагаме филтри за качество и подбираме данни за контролирано дообучаване (SFT). С помощта на SmolLM2-135M-Instruct и LoRA демонстрираме…

MarkTechPost

Google AI току-що пусна Gemini 3.7 Flash: модел за програмиране и агенти на цена $0,75/1 млн входни токена

Google пусна Gemini 3.7 Flash — усъвършенствана версия на Gemini 3.6 Flash с алгоритмични подобрения в ядрото за разсъждения. Моделът обработва текст, изображения, аудио и видео в контекстен прозорец от 1 млн. токена с изход до 64 хил. токена и поддържа персонализируеми конфигурации за мислене. Програмиране…

MarkTechPost

Liquid AI пусна LFM2.5-VL-3B: 3B модел за зрение и език, която анализира екрани, локализира обекти и извиква инструменти на устройството

Liquid AI пусна LFM2.5-VL-3B — модел за зрение и език с 3,1 млрд. параметъра, предназначен за работа на устройства. Той постига среден резултат 80,7 в ScreenSpot-v2 и повишава резултата при локализиране на обекти в RefCOCO от 57,1 до 87,9. Извикването на функции е новост за VL линията, като резултатът в ToolSandbox се повишава от 26,4 до 59,5…

MarkTechPost

Dyna Robotics представи Dyna-2: модел на действията в света, предварително обучен на 1 милион часа човешко видео

Dyna Robotics представи Dyna-2 — модел на действията в света, предварително обучен на повече от един милион часа егоцентрично видео с хора. Техническият доклад установява три резултата: закон за мащабирането върху човешки данни до 1 млн. часа, първото пренасяне на този закон…

MarkTechPost

SpaceXAI представи Grok 4.6: граничен модел с контекст от 500K, оптимизиран за дълго работещи агенти, програмиране и работа със знания

SpaceXAI представи Grok 4.6 на 12 август 2026 г. — надграждане след обучението спрямо Grok 4.5, а не по-голям базов модел. Той изравнява GPT-5.6 Sol Max с резултат 61 в Artificial Analysis Intelligence Index, предлага контекст от 500K и нов режим xhigh…

MarkTechPost

Постобучение на Tulu 3 с AllenAI Open Instruct чрез SFT, DPO, RLVR, GRPO и оценяване на базата на верификатор

Изградете персонализиран конвейер за постобучение на LLM с помощта на рамката Open Instruct на AllenAI. Това изчерпателно ръководство описва надзорно дообучаване (SFT), директна оптимизация на предпочитанията (DPO) и обучение с подсилване с проверими награди (GRPO), оптимизирано за ефективна работа на хардуер с 16 GB, без нужда от тежък…