Open Agent Leaderboard — как оценить эффективность AI-агентов

Система Open Agent Leaderboard для комплексной оценки ИИ-агентов: универсальность, планирование, память, инструменты, Exgentic, SWE-Bench, BrowseComp+, AppWorld, tau2-Bench.

Система Open Agent Leaderboard комплексно оценивает ИИ-агентов. Внимание уделяется не только возможностям отдельной модели, но и всей системе агента целиком. Это включает планирование, память и работу с инструментами.

Главный критерий — универсальность

Основной упор делается на универсальность. Агент должен справляться с разными задачами без дополнительной настройки. Важна и экономичность. Ошибки обходятся дорого: поломка агента может стоить на 20–54% дороже, чем его успешная работа.

Единый подход к тестам

Для оценки используется фреймворк Exgentic, обеспечивающий единообразие задач. Каждая задача включает цель, контекст и допустимые действия. Все методики и результаты открыты, что позволяет сообществу проверять агентов.

Разнообразие тестовых сценариев

Набор тестов охватывает шесть областей, проверяя реальные задачи в различных условиях. Например, SWE-Bench Verified тестирует исправление кода, BrowseComp+ — поиск информации в интернете, а AppWorld — работу с приложениями.

Тесты tau2-Bench предназначены для оценки следования правилам компании в сфере обслуживания и для тестирования техподдержки в телекоме.

Что показывают результаты

Выбор модели остается ключевым фактором, но архитектура агента также имеет значение. Особую роль играет выбор инструментов: это сужает фокус агента и помогает избежать ошибок. Универсальные агенты становятся конкурентными и часто превосходят специализированные системы.

Открытые модели, например DeepSeek V3, пока отстают. Они уступают закрытым решениям на 18–29 процентных пунктов.

Польза для бизнеса

Open Agent Leaderboard помогает бизнесу сравнивать успешность и стоимость выполнения задач. Это позволяет выбрать оптимальный вариант и понять, где именно агент нуждается в улучшении: в модели, запросах или архитектуре.

Присоединяйтесь к разработке

Платформа открыта для сотрудничества: вы можете добавить собственных агентов, упаковав их в Exgentic, интегрировать новые тесты или прислать результаты для открытых моделей.

Ранее по теме
Microsoft и OpenAI: новое ИИ-партнерство до 2032 года

Больше новостей в нашем Телеграм. Подпишись!

Ссылка на источник тык.

Read more

Визуализация нейросети Grok 4.7 от SpaceXAI с параметрами 2,1 триллиона

SpaceXAI выпустит Grok 4.7 для инженеров 12 сентября

Дата выхода и возможности SpaceXAI выпустит нейросеть Grok 4.7 12 сентября — ровно через месяц после выхода Grok 4.6. Технические характеристики новой версии стали еще внушительнее: * Масштаб: модель насчитывает 2,1 триллиона параметров. * Эффективность: обработка данных стала качественнее и точнее, чем в Grok 4.6. * Скорость: время генерации ответов

Смартфон с функциями Gemini AI и интерфейсом Android 14 в обновлении September Android Drop

Android получил Gemini для поиска вещей и Motion Assist

Обновление September Android Drop принесло ряд полезных функций. Google интегрировал Gemini AI для упрощения повседневных задач, добавил инструменты для комфортных поездок и обновил Google Messages. Ai и доступность В Find Hub появилась функция Remembered Items для Android 14 и новее. Теперь можно запоминать, где лежат вещи, не используя цифровые метки

Визуализация работы модели Atlas: генерация 3D-объектов и пространственного интеллекта от World Labs

Atlas создает 3D-миры по одному фото

Пространственный интеллект и модель atlas Atlas — это мультимодальная модель мира, которая учит AI понимать 3D-объекты и законы физики. Это важный этап на пути к AGI, так как нейросеть начинает осознавать, как предметы реально взаимодействуют в пространстве. Технологии и возможности В основе модели лежит архитектура multimodal autoregressive diffusion transformer. В отличие

Логотип OpenAI и элементы цифровой защиты: безопасность новой флагманской ИИ-модели от кибератак

Новая модель OpenAI создает эксплойты и атаки

Безопасность новой модели openai OpenAI усиливает защиту своей будущей флагманской модели. Она оказалась настолько мощной, что компания была вынуждена активировать строгие протоколы безопасности. Многие риски, которые раньше считались теоретическими, стали реальностью. Сейчас разработчики ищут баланс: AI должен оставаться полезным инструментом для кибербезопасности, но при этом не иметь возможности самостоятельно атаковать

Хочешь больше информации про автоматизацию и AI?

В ТГ-канале «Дети нейросети» рассказываю про автоматизацию бизнеса.

Автоматизироваться
Дети Нейросети © 2026