AI News

Arena, стартап, наиболее известный благодаря публичной таблице лидеров, которую многие ИИ-лаборатории используют для сравнения производительности моделей, заявляет, что всего через восемь месяцев после запуска платного продукта компания стала бизнесом с годовым оборотом в 100 миллионов долларов. По данным TechCrunch, компания достигла этого показателя после внедрения в сентябре коммерческого сервиса, который превращает данные пользовательской оценки и результаты тестирования сообществом в аналитику для разработчиков моделей и корпоративных клиентов.

Это заявление имеет значение, выходящее за рамки истории роста одного стартапа. Arena начиналась как исследовательский проект в Калифорнийском университете в Беркли в 2023 году и стала привычным элементом экосистемы ИИ, поскольку предложила открытый, краудсорсинговый способ сравнения моделей друг с другом. Если отчетная выручка компании верна, это показывает, что сама по себе оценка становится ключевым уровнем стека генеративного ИИ (Generative AI): не просто публичным табло для энтузиастов моделей, а рабочим процессом, за который лаборатории и предприятия готовы платить, стремясь к повышению качества при постобучении и развертывании.

От публичной таблицы лидеров к платной платформе оценки

Arena создала свою репутацию на простой модели взаимодействия. На её потребительском сайте пользователь отправляет запрос, система направляет его в две ИИ-модели, и пользователь выбирает, какой результат лучше. Со временем эти попарные суждения наполняют таблицу лидеров, которая, как сообщает TechCrunch, была сформирована на основе более чем 10 миллионов пользовательских оценок.

Эта система публичного рейтинга по-прежнему остается бесплатной, согласно отчету. Коммерческий сдвиг произошел в сентябре, когда Arena запустила AI Evaluations — сервис, нацеленный на ИИ-лаборатории и предприятия. TechCrunch описывает продукт как инструмент, предоставляющий более глубокую аналитику производительности, основанную на данных, собранных сообществом оценщиков Arena.

Такое позиционирование важно. Arena не продает базовую модель, доступ к выводу или продукт прикладного уровня. Она продает обратную связь, бенчмаркинг и сравнительный анализ производительности в то время, когда лаборатории пытаются извлечь выгоду из постобучения (post-training), методов подкрепления, настройки безопасности и оптимизации под конкретные задачи.

TechCrunch сообщает, что Arena оценивает модели в области текста, программирования, зрения и генерации изображений, а недавно добавила «Режим агента» (Agent Mode), ориентированный на сложные и длительные рабочие процессы. Это расширение имеет значение, потому что простое сравнение чат-ботов больше не охватывает весь спектр задач, которые волнуют предприятия. Покупателям всё чаще нужны доказательства надежности при выполнении задач по программированию, работе с мультимодальными входными данными и агентскими цепочками, включающими множество шагов и инструментов.

Почему эта цифра важна сейчас

Время помогает объяснить, почему инвесторы и клиенты обращают на это внимание. В январе Arena привлекла 150 миллионов долларов в рамках раунда серии А при оценке в 1,7 миллиарда долларов после получения инвестиций. В то время, по словам TechCrunch, годовая выручка компании составляла 30 миллионов долларов. Сейчас то же издание сообщает, что за прошедшие месяцы эта цифра выросла до 100 миллионов долларов в годовом исчислении.

Даже с учетом условного характера расчетов годового оборота, это резкое ускорение. Оно предполагает, что спрос на оценку и поддержку постобучения растет вместе с самим рынком моделей. По мере того как выпуски моделей становятся всё более частыми, а разрывы в производительности — всё меньше, ценность достоверного сравнительного тестирования возросла. Лаборатория больше не может полагаться только на победы в широких бенчмарках, если клиентов волнует производительность в конкретных доменах, риск регрессии или поведение модели в реальных пользовательских запросах.

Рост Arena также отражает более широкую коммерческую реальность в ИИ: по мере того как доступ к моделям становится проще, дифференциация смещается в сторону данных, настройки, производительности рабочих процессов и доверия. Публичная таблица лидеров может привлечь внимание сообщества, но платный аналитический слой позволяет монетизировать ту же базовую деятельность по оценке, если клиенты верят в полезность сигнала.

Есть еще один стратегический угол зрения. Публичный сервис Arena дает ей редкое положение на рынке: компания находится в непосредственной близости к запускам моделей и часто выигрывает от интереса пользователей к тестированию недавно выпущенных или даже еще не выпущенных моделей. Это дает компании преимущество в сборе данных и прозрачности, которое было бы трудно быстро воссоздать с нуля.

Бизнес-модель сильна, но терминология имеет значение

Одной из наиболее примечательных деталей в отчете TechCrunch является то, что исполнительный директор Arena Анастасиос Ангелопулос, как сообщается, уточнил, что компания использует ценообразование на основе потребления. Другими словами, цифра в 100 миллионов долларов — это не традиционная регулярная годовая выручка (ARR), основанная на подписках или контрактных расходах.

Это различие важно для любого, кто пытается оценить бизнес. Выручка от потребления может расти быстрее, чем SaaS на основе количества пользователей, особенно когда клиенты быстро увеличивают использование. Но она также может быть более волатильной. Если ИИ-лаборатории сократят тестирование, консолидируют поставщиков или переведут часть оценочной работы внутрь компании, расходы могут вести себя не так, как «липкие» подписки на программное обеспечение.

TechCrunch отмечает, что Arena называет эту цифру ARR, при этом признавая, что выручка не является регулярной в обычном смысле. Поэтому читателям следует воспринимать эту цифру как годовой оборот, основанный на текущем использовании, а не как полностью контрактную базу регулярной выручки.

Это не делает веху менее важной. Это просто означает, что структура бизнеса, вероятно, выглядит иначе, чем классическое корпоративное программное обеспечение. Для разработчиков и инвесторов правильный вопрос заключается не столько в том, подходит ли акроним, сколько в том, становится ли использование оценки достаточно глубоко встроенным в циклы разработки, чтобы создать устойчивый спрос.

Конкуренция — это не только другие стартапы с таблицами лидеров

Сообщаемый успех Arena пришел, несмотря на то, что прямых аналогов, по-видимому, мало. TechCrunch отмечает, что Yupp, еще один краудсорсинговый стартап по выбору ИИ-моделей, закрылся в марте. Ангелопулос сообщил изданию, что Arena вместо этого конкурирует за тот же бюджет, что и провайдеры человеческой разметки и постобучения, такие как Mercor, Surge и Scale AI.

Это сравнение показательно. Оно позиционирует Arena не как медиа-ресурс или сайт бенчмаркинга, а скорее как инфраструктуру для улучшения моделей. Человеческие оценщики, данные о предпочтениях, рейтинговые системы и глубокая аналитика — всё это служит одной цели: заставить модели работать лучше в задачах, которые важны для разработчиков.

TechCrunch связывает рост Arena с более широкими признаками того, что рынок постобучения быстро расширяется. Издание цитирует предыдущие сообщения The Information о том, что валовая годовая выручка Handshake от обучения ИИ выросла с 550 миллионов до почти 1 миллиарда долларов в период с января по апрель, а годовая выручка Mercor превысила 1 миллиард долларов ранее в этом году, после того как в сентябре прошлого года она составляла около 500 миллионов долларов. Эти цифры являются контекстом вторичного рынка, а не свежими данными из отчета самой Arena, но они подтверждают идею о том, что операции по оценке, разметке и обучению ИИ становятся крупными категориями расходов.

Для рынка это означает, что поле битвы смещается. Поставщики моделей по-прежнему конкурируют в перспективных выпусках, но растущая доля ценности может находиться в слоях, которые подсказывают клиентам, какая модель лучше, почему она лучше и как её улучшить.

Доказательства, подтверждения и то, что пока не проверено

Основная информация в этой истории исходит из репортажа TechCrunch, включая заявления, приписываемые генеральному директору Arena Анастасиосу Ангелопулосу. Таким образом, цифра в 100 миллионов долларов Arena является вехой выручки, о которой сообщила компания, а не независимо проверенным финансовым раскрытием в предоставленном исходном материале.

Несколько других важных деталей также взяты из отчета TechCrunch: Arena зародилась как проект Калифорнийского университета в Беркли в 2023 году; коммерческий продукт AI Evaluations был запущен в сентябре; публичная таблица лидеров отражает более 10 миллионов пользовательских оценок; в январе у компании была заявленная годовая выручка в 30 миллионов долларов; и она привлекла в общей сложности 250 миллионов долларов от таких инвесторов, как Felicis, Andreessen Horowitz, Kleiner Perkins, Lightspeed и другие.

В отчете также указаны соучредители Arena: Ангелопулос, технический директор Вэй-Линь Чан (Wei-Lin Chiang) и профессор Калифорнийского университета в Беркли и соучредитель Databricks Ион Стойка (Ion Stoica), который консультировал проект до регистрации компании в апреле 2025 года.

Что остается неопределенным, так это точный состав годового оборота в 100 миллионов долларов. Предоставленный источник не раскрывает количество клиентов, средний чек, удержание, валовую прибыль или соотношение между ИИ-лабораториями и корпоративными покупателями. Он также не предлагает стороннего подтверждения того, насколько предиктивной является публичная таблица лидеров Arena для реальных результатов в производстве. Эти пробелы важны, потому что многие企业 (предприятия) сейчас хотят оценки, специфичной для домена, а не просто сигналов широкой популярности или предпочтений сообщества.

Что это значит для разработчиков ИИ и корпоративных покупателей

Для разработчиков моделей рост Arena подчеркивает практическую истину: выпуска одной сильной модели уже недостаточно. Командам нужна постоянная оценка по выпускам, типам задач и длительности рабочих процессов. Сервис, способный быстро выявлять данные о предпочтениях, сравнительную аналитику и регрессии, может сократить циклы итераций и снизить риск продвижения более слабой контрольной точки.

Для команд, занимающихся приложениями, история немного другая. Публичные таблицы лидеров — полезные инструменты для открытия, но производственные решения обычно требуют более узких тестов, привязанных к собственным запросам, политикам и порогам сбоев компании. Коммерческий рывок Arena предполагает, что существует спрос на внешнюю инфраструктуру оценки, но покупателям всё равно следует спрашивать, отражает ли тестовый набор их случай использования, являются ли суждения воспроизводимыми и как быстро поставщик может обнаружить регрессии после обновления модели.

Для предприятий более важным следствием является процесс закупок. Оценка переходит из функции ситуативного исследования в отдельную статью расходов, которая может стоять рядом с доступом к моделям, защитными ограждениями (guardrails), наблюдаемостью и разметкой данных. Это может улучшить дисциплину развертывания, но также создает дублирование между поставщиками, предлагающими бенчмаркинг, обратную связь от людей, «красную» команду (red-teaming) и поддержку постобучения. Покупателям нужно будет различать широко полезный сигнал и дорогие, но общие панели мониторинга.

За чем следить дальше

Следующий сигнал, за которым стоит наблюдать, — превратит ли Arena свою текущую динамику оборота в долгосрочные корпоративные контракты или останется в основном сервисом, ориентированным на использование и привязанным к темпам запуска моделей. Больше подробностей о составе клиентов и удержании помогли бы прояснить это.

Второй вопрос: будут ли крупные лаборатории усиливать свою зависимость от сторонних платформ оценки или строить больше этого стека внутри компании. Если внешние платформы продолжат выигрывать бюджеты, оценка может стать отдельной крупной категорией программного обеспечения и услуг. Если лаборатории переведут работу внутрь, независимым провайдерам, возможно, придется специализироваться дальше.

В-третьих, следите за тем, как развивается «Режим агента» (Agent Mode) Arena. Если клиенты будут всё чаще оценивать длительные рабочие процессы, а не одношаговые запросы, компания сможет стать более актуальной для корпоративных покупателей, развертывающих агентов, а не просто для разработчиков моделей, гоняющихся за местом в таблице лидеров.

Наконец, следите за вниманием к бенчмаркам и прозрачности. По мере того как оценка превращается в критически важную бизнес-инфраструктуру, клиенты будут требовать больше ясности в методологии, предвзятости выборки, воспроизводимости и того, соответствуют ли публичные рейтинги реальным производственным результатам.

Перспектива от Creati.ai

Сообщаемый рост Arena — полезный маркер того, куда направляются расходы на ИИ. Слой моделей по-прежнему получает больше всего внимания, но эта история предполагает, что рынок всё больше ценит механизмы вокруг моделей: ранжирование, обратную связь, настройку и доказательство качества. Это особенно верно сейчас, когда различия между моделями могут быть тонкими, быстро меняющимися и сильно зависящими от дизайна рабочего процесса.

Предостережение заключается в том, что не все оценочные сигналы равноценны. Данные о предпочтениях толпы могут быть мощными, но предприятиям нужны доказательства того, что таблица лидеров переводится в реальную операционную производительность в их собственных задачах. Если Arena сможет преодолеть этот разрыв — сохраняя открытость, которая сделала её влиятельной, при этом демонстрируя строгую ценность в платных развертываниях, — она может помочь определить категорию, которая находится где-то между лабораторией бенчмаркинга, платформой данных и вендором постобучения.

Рекомендуемые

Arena заявляет, что её бизнес по оценке ИИ достиг годового темпа выручки в $100 млн менее чем за год после запуска

Arena, стартап из Беркли, стоящий за одной из самых пристально отслеживаемых краудсорсинговых таблиц лидеров моделей ИИ, сообщил TechCrunch, что достиг $100 млн годовой выручки в пересчёте на годовой темп примерно через восемь месяцев после запуска своего коммерческого продукта для оценки. Этот рубеж показывает, что бенчмаркинг ИИ и обратная связь после обучения становятся самостоятельным бизнесом, а не просто исследовательской задачей, хотя компания говорит, что её выручка основана на потреблении, а не на контрактной повторяющейся ARR.