Sakhanda Wire
NVDA MSFT GOOGL META AMZN
← Към новините

DiffusionGemma на Google доказва, че не е нужно да обучавате модел за текстова дифузия от нулата

Вместо да обучава нов модел от нулата, Google DeepMind адаптира Gemma 4 в дифузионен модел, използвайки по-малко от 10 процента от първоначалния бюджет за обучение. DiffusionGemma генерира 256 токена паралелно, вместо един по един, като достига около 1 500 токена в секунда. Качеството все още изостава от оригиналния авторегресивен модел в бенчмарковете, особено при задачи за разсъждение.

Статията DiffusionGemma на Google доказва, че не е нужно да обучавате модел от нулата, за да създадете текстов дифузионен модел беше публикувана първоначално в The Decoder.

Това издание публикува в потока си само началото на статията, а пълният текст остава на неговия сайт. Цялата статия е на връзката по-долу.

Първоначално публикувано от The Decoder на

Прочетете оригинала в The Decoder ↗

Текстът и изображенията са собственост на The Decoder и са възпроизведени тук с посочване на авторството и връзка към оригиналната публикация.

← Към новините

Още новини

Всички последни новини