collections/unsloth/nvfp4

huggingface.co
Открыть сайт

Unsloth выкатили Gemma 4 NVFP4 quants . Заявка простая: быстрее 4-bit inference на Blackwell GPU без обычного компромис

Unsloth выкатили Gemma 4 NVFP4 quants . Заявка простая: быстрее 4-bit inference на Blackwell GPU без обычного компромисса “сжали, но стало заметно тупее”. Главные цифры: * Gemma-4-12B NVFP4 запускается на 11 GB VRAM * Gemma-4-26B-A4B доходит до 13K tok/s на B200 * NVFP4 даёт до 1.5× ускорения на GPU NVFP4 - это не просто “ещё один 4-bit формат”. Он заточен под Blackwell и позволяет делать inference быстрее, сохраняя точность лучше, чем грубая квантизация. Для локального и self-hosted inference это важный сдвиг: больше моделей помещается в память, throughput растёт, стоимость токена падает. Особенно полезно для тех, кто гоняет много коротких запросов, агентные пайплайны или batch-инференс, где скорость и VRAM решают всё. Blog: https://unsloth.ai/docs/basics/nvfp4 Gemma NVFP4: https://huggingface.co/collections/unsloth/nvfp4

Характеристики

Тип Инструмент
КатегорияAI-агенты
Язык сайтаen

Найден в источниках

Похожие в разделе «AI-агенты»

Предложить сайт в каталог

Пришлите ссылку — остальное мы выясним сами.

Мы рассмотрим, что вы прислали, и добавим в каталог, если подойдёт.

Не знаете, как внедрить? Мы поможем

Расскажите про задачу — подберём инструменты и подскажем, с чего начать.

0 / 5000
Проверочный код

Поля со звёздочкой обязательны. Данные используются только для ответа.