MInference

github.com
Открыть сайт

To speed up Long-context LLMs' inference, approximate and dynamic sparse calculate the attention, which reduces inference latency by up to 10x for pre-filling on an A100 while maintaining accuracy.

Описание

Характеристики

Тип Репозиторий
КатегорияGitHub-проекты / Из awesome-списка
Цена открытый код
Платформа Своё развёртывание
Системы исходный код
Язык сайтаen
GitHubmicrosoft/MInference

Платформы

Исходный код

microsoft/MInference

Найден в источниках

Похожие в разделе «GitHub-проекты»

Предложить сайт в каталог

Пришлите ссылку — остальное мы выясним сами.

Мы рассмотрим, что вы прислали, и добавим в каталог, если подойдёт.

Не знаете, как внедрить? Мы поможем

Расскажите про задачу — подберём инструменты и подскажем, с чего начать.

0 / 5000
Проверочный код

Поля со звёздочкой обязательны. Данные используются только для ответа.