arena.ai
Chat, compare, vote for the world's best AI models. Join the community shaping the public leaderboard for LLMs, image, and code models through real-world evaluation.
Chat, compare, vote for the world's best AI models. Join the community shaping the public leaderboard for LLMs, image, and code models through real-world evaluation.
OpenHands helps engineers automate repetitive coding tasks.
Модель image-text-to-text · лицензия apache-2.0
Модель image-text-to-text · лицензия apache-2.0
Модель text-generation · лицензия apache-2.0
Модель image-text-to-text · лицензия apache-2.0
Модель sentence-similarity · лицензия mit
—
—
—
—
Модель text-generation · лицензия mit
Framework for building LLM agent benchmark environments in a Python-centric way.
—
Модель image-text-to-text · лицензия apache-2.0
—
—
—
Бенчмарк и лидерборд для ИИ-агентов, чинящих реальные issue из GitHub-репозиториев
Independent benchmarks comparing AI models on quality, speed, and cost.
Модель text-generation · лицензия apache-2.0
Модель text-generation · лицензия apache-2.0
Исследовательский институт: данные и бенчмарки о траектории развития ИИ
Модель text-generation · лицензия apache-2.0
Модель text-generation · лицензия apache-2.0
LLaVA-OneVision-2-8B : мультимодальная модель анализирует видеопоток через кодек вместо нарезки кадров Исследователи из Glint Lab, AIM for Health Lab и MVP Lab опубликовали LLaVA-OneVision-2 — мультимодальную модель нового поколения, которая переосмысливает то, как нейросеть «смотрит» видео.
LLaVA-OneVision-2-8B : мультимодальная модель анализирует видеопоток через кодек вместо нарезки кадров Исследователи из Glint Lab, AIM for Health Lab и MVP Lab опубликовали LLaVA-OneVision-2 — мультимодальную модель нового поколения, которая переосмысливает то, как нейросеть «смотрит» видео.
LLaVA-OneVision-2-8B : мультимодальная модель анализирует видеопоток через кодек вместо нарезки кадров Исследователи из Glint Lab, AIM for Health Lab и MVP Lab опубликовали LLaVA-OneVision-2 — мультимодальную модель нового поколения, которая переосмысливает то, как нейросеть «смотрит» видео.
Claude Sonnet 4.5 побеждает на backend-бенчмарке ABC-Bench , лучше всех справившись с кодом и настройкой окружения ABC-Bench — первый бенчмарк, который проверяет способность ИИ-агентов решать полноценные задачи backend-разработки: от изучения кода в репозитории до настройки окружения и запуска сервиса в контейнере.
Claude Sonnet 4.5 побеждает на backend-бенчмарке ABC-Bench , лучше всех справившись с кодом и настройкой окружения ABC-Bench — первый бенчмарк, который проверяет способность ИИ-агентов решать полноценные задачи backend-разработки: от изучения кода в репозитории до настройки окружения и запуска сервиса в контейнере.
️ 💊 Baichuan-M3: открытая медицинская модель ведет диалог как настоящий врач, обходя GPT-5.2-High и людей в точности диагностики Baichuan-M3 ведет себя как опытный терапевт — методично выясняет детали: когда именно началась боль, какого она характера, есть ли сопутствующие симптомы, какие лекарства принимались, были ли подобные эпизоды раньше.
️ 💊 Baichuan-M3: открытая медицинская модель ведет диалог как настоящий врач, обходя GPT-5.2-High и людей в точности диагностики Baichuan-M3 ведет себя как опытный терапевт — методично выясняет детали: когда именно началась боль, какого она характера, есть ли сопутствующие симптомы, какие лекарства принимались, были ли подобные эпизоды раньше.
ClawBench : лучший ИИ-агент справился лишь с 33% реальных повседневных задач в интернете Исследователи из UBC, Vector Institute и CMU представили ClawBench — бенчмарк для проверки ИИ-агентов на реальных сайтах.
ClawBench : лучший ИИ-агент справился лишь с 33% реальных повседневных задач в интернете Исследователи из UBC, Vector Institute и CMU представили ClawBench — бенчмарк для проверки ИИ-агентов на реальных сайтах.
ClawBench : лучший ИИ-агент справился лишь с 33% реальных повседневных задач в интернете Исследователи из UBC, Vector Institute и CMU представили ClawBench — бенчмарк для проверки ИИ-агентов на реальных сайтах.
ClawBench : лучший ИИ-агент справился лишь с 33% реальных повседневных задач в интернете Исследователи из UBC, Vector Institute и CMU представили ClawBench — бенчмарк для проверки ИИ-агентов на реальных сайтах.