sakana.ai

sakana.ai
Visit site

AI-агенты в реальном мире: почему они не работают и как это исправить → Хабр Исследование показывает, что большинст

Sakana AI — инновационная компания в области исследований и разработок AI, специализирующаяся на создании трансформационных фундаментальных моделей, вдохновлённых природными процессами, такими как эволюция и коллективный интеллект. Их флагманский продукт, AI Scientist, — первая полностью автоматизированная система, способная самостоятельно проводить научные исследования: от генерации идей и экспериментов до написания и рецензирования статей. Sakana AI также повышает эффективность AI с помощью инструментов, таких как AI CUDA Engineer, который автоматизирует оптимизацию GPU-кода для ускорения обучения и инференса до 100 раз. При поддержке крупных инвесторов, включая NVIDIA и ведущие японские корпорации, Sakana AI стремится создать мирового класса AI-лабораторию для устойчивых, эффективных и передовых технологий AI, решающих сложные задачи.

AI-агенты в реальном мире: почему они не работают и как это исправить → Хабр Исследование показывает, что большинство AI-агентов не оправдывают ожиданий при внедрении из-за фундаментальных проблем оценки и надёжности. Для создания реально работающих систем разработчикам необходимо сменить фокус с расширения возможностей на обеспечение «пяти девяток» надёжности. Статья на основе презентации от Sayash Kapoor (соавтор книги и популярного блога «AI Snake Oil», один из самых влиятельных людей в сфере ИИ по версии TIME), очень наглядно и точно открывает проблемы, которые стоят перед AI-агентами и AI-инженерами. Очень рекоменду к чтению/просмотру. ⭕️ Проблемы оценки — Громкие заявления разбиваются о реальность при детальной проверке. — Стэнфордские исследователи выявили галлюцинации в "безошибочных" юридических AI. — Лучшие научные агенты воспроизводят менее 40% опубликованных результатов. — Sakana.ai заявила о 150-кратном ускорении CUDA-ядер сверх теоретического максимума. ◾️ Бенчмарки обманчивы — Агенты Cognition получили $175 млн при оценке $2 млрд за успехи в S-bench. — Но в реальном использовании их Devin преуспел только в 3 из 20 задач. — Claude 3.5 и OpenAI o1 показывают равную точность, но разницу в цене в 11 раз ($57 vs $664). — Чем больше снижается стоимость LLM, тем выше общее потребление (парадокс Джевонса). 🔹 Надёжность vs возможности — 90% точности недостаточно для коммерческих продуктов. — Агент с 80% точностью заказов еды — катастрофический провал для пользователя. — Верификаторы тоже несовершенны: в бенчмарках кода бывают ложноположительные тесты. — Нужно инженерное мышление первых разработчиков компьютеров с вакуумными лампами. Видео → Все статьи

Specs

Type Tool
SectionAI agents
Platform Web only
Systems api, web
Site languageru
Rating5.00 (1 reviews)
Views1 814 002
Launched2026-06-22

Social

Found in sources

Similar in «AI agents»

Submit a site to the catalog

Just send the link — we will work out the rest.

We will review what you send and add it to the catalog if it fits.

Not sure how to implement it? We can help

Tell us about your task — we will pick the tools and suggest where to start.

0 / 5000
Verification code

Fields marked with an asterisk are required. Your data is used only to reply.