To speed up Long-context LLMs' inference, approximate and dynamic sparse calculate the attention, which reduces inference latency by up to 10x for pre-filling on an A100 while maintaining accuracy.
| Тип | Репозиторий |
| Категория | GitHub-проекты / Из awesome-списка |
| Цена | открытый код |
| Платформа | Своё развёртывание |
| Системы | исходный код |
| Язык сайта | en |
| GitHub | microsoft/MInference |