Type

Tag “Benchmark” — 20

LLaVA-OneVision-2-8B : мультимодальная модель анализирует видеопоток через кодек вместо нарезки кадров Исследователи из Glint Lab, AIM for Health Lab и MVP Lab опубликовали LLaVA-OneVision-2 — мультимодальную модель нового поколения, которая переосмысливает то, как нейросеть «смотрит» видео.

Tool Video

LLaVA-OneVision-2-8B : мультимодальная модель анализирует видеопоток через кодек вместо нарезки кадров Исследователи из Glint Lab, AIM for Health Lab и MVP Lab опубликовали LLaVA-OneVision-2 — мультимодальную модель нового поколения, которая переосмысливает то, как нейросеть «смотрит» видео.

Tool Video

LLaVA-OneVision-2-8B : мультимодальная модель анализирует видеопоток через кодек вместо нарезки кадров Исследователи из Glint Lab, AIM for Health Lab и MVP Lab опубликовали LLaVA-OneVision-2 — мультимодальную модель нового поколения, которая переосмысливает то, как нейросеть «смотрит» видео.

Tool Video

openmoss/abc-bench

github.com

Claude Sonnet 4.5 побеждает на backend-бенчмарке ABC-Bench , лучше всех справившись с кодом и настройкой окружения ABC-Bench — первый бенчмарк, который проверяет способность ИИ-агентов решать полноценные задачи backend-разработки: от изучения кода в репозитории до настройки окружения и запуска сервиса в контейнере.

Tool Directories & rankings

Claude Sonnet 4.5 побеждает на backend-бенчмарке ABC-Bench , лучше всех справившись с кодом и настройкой окружения ABC-Bench — первый бенчмарк, который проверяет способность ИИ-агентов решать полноценные задачи backend-разработки: от изучения кода в репозитории до настройки окружения и запуска сервиса в контейнере.

Tool Directories & rankings

️ 💊 Baichuan-M3: открытая медицинская модель ведет диалог как настоящий врач, обходя GPT-5.2-High и людей в точности диагностики Baichuan-M3 ведет себя как опытный терапевт — методично выясняет детали: когда именно началась боль, какого она характера, есть ли сопутствующие симптомы, какие лекарства принимались, были ли подобные эпизоды раньше.

Tool Images

️ 💊 Baichuan-M3: открытая медицинская модель ведет диалог как настоящий врач, обходя GPT-5.2-High и людей в точности диагностики Baichuan-M3 ведет себя как опытный терапевт — методично выясняет детали: когда именно началась боль, какого она характера, есть ли сопутствующие симптомы, какие лекарства принимались, были ли подобные эпизоды раньше.

Tool Images

os-world.github.io

os-world.github.io

ClawBench : лучший ИИ-агент справился лишь с 33% реальных повседневных задач в интернете Исследователи из UBC, Vector Institute и CMU представили ClawBench — бенчмарк для проверки ИИ-агентов на реальных сайтах.

Tool Other

ClawBench : лучший ИИ-агент справился лишь с 33% реальных повседневных задач в интернете Исследователи из UBC, Vector Institute и CMU представили ClawBench — бенчмарк для проверки ИИ-агентов на реальных сайтах.

Tool Browser extensions

claw-bench.com

claw-bench.com

ClawBench : лучший ИИ-агент справился лишь с 33% реальных повседневных задач в интернете Исследователи из UBC, Vector Institute и CMU представили ClawBench — бенчмарк для проверки ИИ-агентов на реальных сайтах.

Tool Browser extensions

ClawBench : лучший ИИ-агент справился лишь с 33% реальных повседневных задач в интернете Исследователи из UBC, Vector Institute и CMU представили ClawBench — бенчмарк для проверки ИИ-агентов на реальных сайтах.

Tool Browser extensions

Kimi-K2 и Qwen3-235B - лучшие нейросети для торговли акциями на бирже, GPT-5 и Claude 4 Sonnet далеко позади Китайские исследователи представили StockBench — первый бенчмарк для тестирования LLM-агентов в реальной биржевой торговле.

Tool Directories & rankings

ИИ-агенты справились с 2.5% реальных задач с биржи фрилансеров Исследователи из Center for AI Safety и Scale AI проверили, могут ли ведущие ИИ-агенты заменить фрилансеров.

Tool Directories & rankings

DeepEyesV2 — открытая агентная мультимодальная модель на базе Qwen2.5-VL-7B, которая умеет не просто понимать текст и изображения, но и активно использовать внешние инструменты.

Tool AI agents

DeepEyesV2 — открытая агентная мультимодальная модель на базе Qwen2.5-VL-7B, которая умеет не просто понимать текст и изображения, но и активно использовать внешние инструменты.

Tool AI agents

DeepEyesV2 — открытая агентная мультимодальная модель на базе Qwen2.5-VL-7B, которая умеет не просто понимать текст и изображения, но и активно использовать внешние инструменты.

Tool AI agents

DeepEyesV2 — открытая агентная мультимодальная модель на базе Qwen2.5-VL-7B, которая умеет не просто понимать текст и изображения, но и активно использовать внешние инструменты.

Tool AI agents

prime-rl/p1

github.com

Открытая модель впервые получила золотую медаль на Международной физической олимпиаде IPhO 2025 Модель P1-235B-A22B от Shanghai AI Laboratory стала первой открытой моделью, которая получила золотую медаль на IPhO 2025 — самой престижной физической олимпиаде в мире, где решение каждой задачи требует и аналитической точности, и творческого подхода.

Tool Agent frameworks

prime-rl/p1-235b-a22b

huggingface.co

Открытая модель впервые получила золотую медаль на Международной физической олимпиаде IPhO 2025 Модель P1-235B-A22B от Shanghai AI Laboratory стала первой открытой моделью, которая получила золотую медаль на IPhO 2025 — самой престижной физической олимпиаде в мире, где решение каждой задачи требует и аналитической точности, и творческого подхода.

Tool Agent frameworks

video-reality-test.github.io

video-reality-test.github.io

Лучшая AI-модель на 13% хуже людей распознает сгенерированные ASMR-видео Исследователи из Oxford, NUS и CUHK представили Video Reality Test — первый бенчмарк для тестирования способности VLM отличать настоящие ASMR-видео от сгенерированных.

Tool Directories & rankings

Submit a site to the catalog

Just send the link — we will work out the rest.

We will review what you send and add it to the catalog if it fits.