AI-агенты в реальном мире: почему они не работают и как это исправить → Хабр Исследование показывает, что большинст
Sakana AI — инновационная компания в области исследований и разработок AI, специализирующаяся на создании трансформационных фундаментальных моделей, вдохновлённых природными процессами, такими как эволюция и коллективный интеллект. Их флагманский продукт, AI Scientist, — первая полностью автоматизированная система, способная самостоятельно проводить научные исследования: от генерации идей и экспериментов до написания и рецензирования статей. Sakana AI также повышает эффективность AI с помощью инструментов, таких как AI CUDA Engineer, который автоматизирует оптимизацию GPU-кода для ускорения обучения и инференса до 100 раз. При поддержке крупных инвесторов, включая NVIDIA и ведущие японские корпорации, Sakana AI стремится создать мирового класса AI-лабораторию для устойчивых, эффективных и передовых технологий AI, решающих сложные задачи.
AI-агенты в реальном мире: почему они не работают и как это исправить → Хабр Исследование показывает, что большинство AI-агентов не оправдывают ожиданий при внедрении из-за фундаментальных проблем оценки и надёжности. Для создания реально работающих систем разработчикам необходимо сменить фокус с расширения возможностей на обеспечение «пяти девяток» надёжности. Статья на основе презентации от Sayash Kapoor (соавтор книги и популярного блога «AI Snake Oil», один из самых влиятельных людей в сфере ИИ по версии TIME), очень наглядно и точно открывает проблемы, которые стоят перед AI-агентами и AI-инженерами. Очень рекоменду к чтению/просмотру. ⭕️ Проблемы оценки — Громкие заявления разбиваются о реальность при детальной проверке. — Стэнфордские исследователи выявили галлюцинации в "безошибочных" юридических AI. — Лучшие научные агенты воспроизводят менее 40% опубликованных результатов. — Sakana.ai заявила о 150-кратном ускорении CUDA-ядер сверх теоретического максимума. ◾️ Бенчмарки обманчивы — Агенты Cognition получили $175 млн при оценке $2 млрд за успехи в S-bench. — Но в реальном использовании их Devin преуспел только в 3 из 20 задач. — Claude 3.5 и OpenAI o1 показывают равную точность, но разницу в цене в 11 раз ($57 vs $664). — Чем больше снижается стоимость LLM, тем выше общее потребление (парадокс Джевонса). 🔹 Надёжность vs возможности — 90% точности недостаточно для коммерческих продуктов. — Агент с 80% точностью заказов еды — катастрофический провал для пользователя. — Верификаторы тоже несовершенны: в бенчмарках кода бывают ложноположительные тесты. — Нужно инженерное мышление первых разработчиков компьютеров с вакуумными лампами. Видео → Все статьи
| Type | Tool |
| Section | AI agents |
| Platform | Web only |
| Systems | api, web |
| Site language | ru |
| Rating | 5.00 (1 reviews) |
| Views | 1 814 002 |
| Launched | 2026-06-22 |