Unsloth выкатили Gemma 4 NVFP4 quants . Заявка простая: быстрее 4-bit inference на Blackwell GPU без обычного компромис
Unsloth выкатили Gemma 4 NVFP4 quants . Заявка простая: быстрее 4-bit inference на Blackwell GPU без обычного компромисса “сжали, но стало заметно тупее”. Главные цифры: * Gemma-4-12B NVFP4 запускается на 11 GB VRAM * Gemma-4-26B-A4B доходит до 13K tok/s на B200 * NVFP4 даёт до 1.5× ускорения на GPU NVFP4 - это не просто “ещё один 4-bit формат”. Он заточен под Blackwell и позволяет делать inference быстрее, сохраняя точность лучше, чем грубая квантизация. Для локального и self-hosted inference это важный сдвиг: больше моделей помещается в память, throughput растёт, стоимость токена падает. Особенно полезно для тех, кто гоняет много коротких запросов, агентные пайплайны или batch-инференс, где скорость и VRAM решают всё. Blog: https://unsloth.ai/docs/basics/nvfp4 Gemma NVFP4: https://huggingface.co/collections/unsloth/nvfp4
| Тип | Инструмент |
| Категория | AI-агенты |
| Язык сайта | en |