Последний экзамен агентов
Испытайте и измерьте ИИ-агентов на экономически значимых и реальных задачах. Последний экзамен агентов создает крупнейший и наиболее широкий бенчмарк для оценки агентов на сегодняшний день, измеряя производительность на долгосрочных, экономически значимых задачах с проверяемыми результатами. Под руководством Berkeley RDI и более 300 экспертов из индустрии проект охватывает все 55 целевых подотраслей, охватывающих большинство основных областей профессиональной работы, выполняемой на компьютере, с более чем 1500 собранных задач из целевых 5000, обеспечивая объективные, сопоставимые и значимые оценки в различных областях.
Примеры задач
Анимация и визуальные эффекты
Агенты выполняют задачи по производству анимации и визуальных эффектов в Adobe After Effects.
3D-моделирование
Агенты выполняют задачи по созданию и редактированию 3D-моделей в Siemens NX.
Разработка игр
Настройка сцен, размещение ассетов и задачи рендеринга в Unreal Engine.
Анализ потока форм
Задачи по симуляции и анализу потока форм в программном обеспечении Moldex3D.
Архитектурное моделирование
3D-моделирование и анализ энергопотребления в Rhino 3D для городского дизайна в Цюрихе.
Нейровизуализация
Анализ нейровизуализации и сегментация структур мозга в FSLeyes.
Что отличает Последний экзамен агентов
- Широкий охват: 55 подотраслей.
- Проверяемые результаты: Задачи с четкими критериями успеха.
- Долгосрочные задачи: Экономически значимые и сложные.
Участники и партнеры
Академические учреждения
MIT, Гарвард, Стэнфорд, UC Berkeley, Оксфорд, CMU, Caltech, ETH Zurich, Йель, Колумбия, UPenn, Корнелл, Браун, Johns Hopkins, NIH, UCLA, UCSF, NYU, U Michigan, U Washington, Georgia Tech, USC, UIUC, WashU, U Melbourne, UC San Diego, UC Santa Barbara, UC Irvine, UW-Madison, Emory, UNC, McGill, U Waterloo, Boston University, U Helsinki, Monash, U Colorado, UC Santa Cruz, UC Riverside, Northeastern, Syracuse, Lehigh, UT Southwestern, Texas A&M.
Индустрии
Goldman Sachs, JPMorgan, Morgan Stanley, PIMCO, Adobe, Oracle, Hippocratic AI, HubSpot, Brix, Photon Fund, Snorkel AI, UniPat AI, TCCI.
Консультативный комитет
- Джордж Эм Карниадакис, профессор прикладной математики в Брауне.
- Тапио Шнайдер, профессор климатической динамики в Caltech.
- Тереза Хед-Гордон, профессор вычислительной химии в UC Berkeley.
- Лор Занна, профессор океанологии и климатологии в NYU.
- Джек Галлант, профессор вычислительной нейробиологии в UC Berkeley.
- Тарек Зоуди, профессор вычислительной механики в UC Berkeley.
- Ида Сим, руководитель исследований в UCSF.
- Арвинд Рао, профессор биомедицинской информатики в U Michigan.
- Каан Озбай, директор C2SMART в NYU.
- Карл Беттигер, профессор экологического прогнозирования в UC Berkeley.
- Кайл Штайнфельд, профессор вычислительного дизайна в UC Berkeley.
- Ямини Ранган, CEO HubSpot.
- Брэдли Ротенберг, CEO nTop.
Почему стоит участвовать
- Установите стандарты оценки: Помогите определить стандарты оценки агентов в вашей отрасли.
- Исследование и признание: Получите соавторство в публикациях и денежные награды.
- Инсайты: Узнайте, как ИИ-агенты справляются с реальными задачами.
Как участвовать
Для экспертов
Внесите свои знания и данные о реальных рабочих процессах — программирование не требуется.
Для исследователей и инженеров
Превратите реальные рабочие процессы в сложные, воспроизводимые бенчмарки для агентов.
Часто задаваемые вопросы
Ответы на вопросы о доступе к программному обеспечению, авторстве, сроках и других аспектах.
Контакты
Для вопросов свяжитесь с командой напрямую: rdi_research@berkeley.edu.
Оставайтесь в курсе
Подпишитесь на рассылку для получения новостей, релизов бенчмарков и обновлений.
Последний экзамен агентов — это исследовательский проект UC Berkeley RDI. Все вклады используются для продвижения исследований в области оценки агентов. Набор данных лицензирован под CC BY 4.0, код — под Apache-2.0.
Источники
- Оригинал: agents-last-exam.org — CC BY 4.0