Эксперимент на основе логических выводов: что мы узнали за одну неделю



Вкратце:
Эксперимент оказался очень успешным. В целом, конструкция нашего API для вывода результатов и аппаратная часть, лежащая в его основе, были надежными и обеспечили очень хорошие результаты. Спрос на вывод результатов оказался намного выше, чем мы ожидали. Для удовлетворения высокого спроса на большие модели нам потребуются дальнейшие улучшения. Пока мы будем вносить эти улучшения, эксперимент продолжится в меньшем масштабе, с меньшими моделями.

Недавно мы запустили наш эксперимент по инференции: API для инференции, который позволяет использовать большие языковые модели (LLM), размещенные на нашей инфраструктуре. Вы можете подключить к нему любой агент, тестовую среду или инструмент для программирования по вашему выбору и использовать наши LLM бесплатно. Таким образом, вы можете протестировать работу LLM на мощном оборудовании, а мы тем временем будем накапливать опыт работы с такими моделями.

Теперь, когда эксперименту по выводу данных исполнилась неделя, мы хотели бы поделиться с вами некоторыми сведениями о том, как он работает, о том, что мы узнали, и о том, каким может быть его будущее. Для этого мы хотели бы показать вам хронологию экспериментальной платформы Hetzner и всех экспериментов, проведенных на ней до настоящего времени.



T — 4 месяца: внедрение платформы Hetzner Experiments Platform с OpenClaw.
С тех пор, как мы начали предлагать нашим клиентам серверы с графическими процессорами, мы тестировали способы обслуживания LLM внутри компании. Благодаря многолетнему опыту работы с Kubernetes, мы смогли создать внутреннюю платформу для вывода результатов, которую использовали для тестирования различных конфигураций серверов и программного обеспечения для обслуживания LLM.

В итоге мы остановились на стеке, состоящем из нескольких серверов GEX131, vLLM и Open WebUI. Эта комбинация позволила нам запустить несколько небольших LLM-моделей, которые мы могли использовать для некоторых внутренних приложений производственного уровня. Это также позволило нам тестировать и оценивать производительность более крупных моделей внутри компании.

В начале 2026 года OpenClaw стал очень обсуждаемой темой в сфере искусственного интеллекта. Многие энтузиасты использовали виртуальные машины Hetzner Cloud для тестирования OpenClaw, но столкнулись с трудностями в безопасной настройке сервера. Чтобы помочь нашим клиентам в решении этой проблемы, мы решили предложить OpenClaw в виде предварительно настроенного экземпляра.

Мы быстро создали новую платформу, которая позволила бы нам предлагать не только OpenClaw, но и другие услуги и продукты, с которыми мы, возможно, захотим поэкспериментировать в будущем. Это позволило бы быстро внедрять изменения и проводить эксперименты, при этом предоставляя меньше гарантий, чем наши более зрелые продукты. Одной из ключевых особенностей стало бы ценообразование: первоначально мы предлагали бы все эксперименты совершенно бесплатно.

OpenClaw также предоставил возможность получить опыт работы с самостоятельным размещением систем вывода. Наш OpenClaw поставлялся с предварительно настроенным собственным API для вывода. API не был общедоступным, а был ограничен OpenClaw, поэтому мы могли в определенной степени контролировать объем запросов. Предлагая вывод только через OpenClaw, мы могли опробовать несколько небольших моделей с открытыми весами в различных конфигурациях. А наши клиенты получали продукт на основе ИИ, полностью разработанный для ЕС.

Чтобы продемонстрировать уникальность платформы Hetzner Experiments Platform, мы создали для нее отдельную панель интерфейса на сайте experiments.hetzner.com

Этот ограниченный эксперимент с OpenClaw дал нам много ценных выводов:
  • Небольшие модели, такие как Qwen 3.6, оказались достаточными для большинства сценариев использования OpenClaw.
  • GEX131 с одной видеокартой RTX PRO 6000 Blackwell был достаточен для небольших моделей LLM, но не мог эффективно запускать большие модели.
  • Многие пользователи высоко оценили тот факт, что это полностью разработано для стран ЕС.
  • Качество кода OpenClaw было постоянной проблемой: каждый новый релиз OpenClaw приносил новые трудности, поскольку количество ошибок в исходном коде было довольно велико.

T — 1 месяц: получение специализированного оборудования
В компании Hetzner наши команды разработчиков оборудования постоянно работают над новыми моделями серверов. Одной из таких моделей стал новый сервер, созданный по индивидуальному заказу, в котором вместо одной видеокарты GEX131 размещено восемь графических процессоров RTX PRO™ 6000 Blackwell. Это значительно улучшает возможности сервера для работы с более крупными моделями.

С помощью некоторых из этих серверов с 8 графическими процессорами мы могли бы предлагать нашим клиентам более крупные модели. Эксперимент OpenClaw уже показал, что наши клиенты заинтересованы в темах, связанных с искусственным интеллектом и выводом данных. Однако качество программного обеспечения OpenClaw оставалось проблемой.

Для решения этой проблемы мы решили предложить вывод результатов напрямую в виде API, соответствующего спецификации OpenAI, который мог бы использовать каждый, без необходимости обращаться в OpenClaw. Все, что им понадобится, — это токен авторизации, который они смогут сгенерировать через experiments.hetzner.com на отдельной вкладке «Вывод результатов».

T — 2 недели: сравнительный анализ и выбор подходящих моделей.
Затем последовало множество сравнительных анализов и исследований рынка.

Мы составили список программ магистратуры в области права, которые хотели бы предложить:
  • Qwen/Qwen3.6-35B-A3B
  • Код Kimi-K2.7
  • GLM-5.2
  • DeepSeek-V4-Flash-0731

Qwen продолжит эксперимент OpenClaw в качестве меньшей, «базовой» модели. Kimi предложит альтернативу двум крупнейшим моделям, GLM и DeepSeek, ориентированную на программирование. Каждая из этих моделей представляет собой новейшую версию соответствующего семейства LLM.

Единственным исключением был Kimi: K3 уже вышел и обещал отличные результаты в публичных тестах. Однако очень специфические лицензионные требования K3 не позволяли нам предложить его в качестве бесплатного эксперимента.

T — 1 неделя: заключительные приготовления
В рамках заключительной подготовки к эксперименту по формированию выводов некоторые внутренние компоненты были переработаны, чтобы справиться с ожидаемым высоким спросом.

Маршрутизация запросов на вывод значительно улучшилась благодаря внедрению llm-d и внесению изменений в некоторые компоненты маршрутизации, разработанные нами внутри компании. Такие функции, как перенос kv-кэша в оперативную память хоста, также обещали существенное повышение производительности.

Мы также добавили еще несколько специализированных серверов с 8 видеокартами и выделили каждый из них для запуска DeepSeek, GLM или Kimi. А серверы GEX131 с одной видеокартой мы используем для обслуживания более компактной модели Qwen 3.6.

T — 0 часов: запуск
Оценить спрос на эксперимент по анализу выводов было сложно заранее. Чтобы подстраховаться, мы распределили запуск на несколько дней:

7 августа мы запустили новые модели и эксперимент по выводу результатов на платформе Hetzner Experiments. Это дало первым пользователям выходные, чтобы выявить любые проблемы, которые мы могли пропустить. После выходных, 10 августа, мы начали активно информировать наших клиентов об эксперименте. Мы ожидали, что сарафанное радио в конечном итоге также повысит спрос.

T + 6 часов: достигнут лимит вместимости.
Информация распространялась быстро: уже через несколько часов мы заметили резкое увеличение запросов к API для вывода результатов. Спрос превзошел наши самые оптимистичные ожидания и продолжал расти высокими темпами.

Модель Qwen 3.6, которая была моделью по умолчанию для OpenClaw, оказалась самой популярной в первый день, как по количеству запросов, так и по количеству сгенерированных токенов. Другие модели также пользовались высоким спросом, но значительно отставали от Qwen.

Наша система смогла обеспечить достаточную пропускную способность для обработки запросов, но мы уже заметили увеличение задержки:

Для 99-го процентиля времени до получения первого токена (TTFT) наблюдались кратковременные скачки в некоторых моделях, но в целом показатели оставались достаточно хорошими, составляя в большинстве случаев от 5 до 10 секунд.

Ещё одним сюрпризом стало резкое увеличение количества экземпляров OpenClaw. Хотя ожидался некоторый рост спроса, число экземпляров в первый же день резко возросло. Наш небольшой кластер Kubernetes для запуска экземпляров OpenClaw быстро достигал предела своей пропускной способности. Поэтому мы отключили вкладку OpenClaw на experiments.hetzner.com для всех учетных записей, которые ещё не вошли в платформу Hetzner Experiments Platform.

T + 1 день: как справиться с спросом
На второй день эксперимента количество запросов на все модели резко возросло, и это повторилось снова.

Стали проясняться закономерности использования:
  • Наибольший интерес вызвал DeepSeek. Многие пользователи сообщили о благоприятных результатах тестирования.
  • Квен оставалась популярной, получала очень много небольших запросов.
  • Модели GLM и Kimi также пользовались большим спросом, но гораздо меньшим, чем две другие. У модели GLM была самая высокая задержка, и она нуждалась в дополнительной доработке.
  • Мы не регистрируем никаких данных о запросах, но наши показатели токенов указывают на то, что многие пользователи в это время все еще запускали тесты производительности.
Однако такое количество запросов превышало возможности нашей экспериментальной инфраструктуры. Время получения первого токена (TTFT) резко возросло, достигнув пика почти в 10 минут для 99-го процентиля, что временами делало API практически непригодным для использования. Наш эксперимент не был рассчитан на такой масштаб запросов, и это сказалось на результатах.

Особенно сложной задачей было большое количество небольших, одновременно обрабатываемых запросов. Чтобы лучше справляться с этим, мы сократили количество принимаемых нами параллельных запросов.

Мы также получили множество отзывов относительно настроек логики различных моделей, которые некоторые пользователи сочли неинтуитивными.


T + 2 дня: дополнительные настройки, больше оборудования
Спрос на обработку данных еще больше возрос, доведя нашу инфраструктуру обработки данных до предела. В то время как количество запросов к конечной точке API снижалось, общее количество входных токенов продолжало расти.



Стремясь увеличить вычислительную мощность, мы смогли собрать еще несколько специализированных серверов с 8 видеокартами и добавили их в пул, обслуживающий GLM, поскольку эта модель в то время испытывала наибольшие трудности.

Теперь закономерности использования стабилизировались и будут наблюдаться до конца недели:
  • DeepSeek столкнулся со все более сложными запросами, содержащими огромное количество входных и выходных токенов.
  • Квен продолжала получать очень большое количество мелких запросов.
  • GLM и Kimi получили запросы среднего размера, но на более низком уровне, чем две предыдущие компании.
  • В среднем количество запросов было больше, чем в первый день. Это указывало на более широкое использование сервиса в практических целях, с большими массивами реальных данных.
  • Благодаря нашим доработкам, во всех моделях наблюдалось повышение производительности.
  • В часы пик большое количество запросов тратило минуты на ожидание в очереди, прежде чем сервер с графическим процессором мог начать обработку запроса на вывод результатов.
В течение недели мы опробовали множество улучшений: общие ограничения скорости обработки запросов были снижены, чтобы дать большему количеству пользователей возможность принять участие в эксперименте. Некоторые модели использования показались нам вредоносными, поэтому мы предприняли шаги по ограничению скорости и фильтрации таких запросов. Фактическое использование также отличалось от результатов наших бенчмарков. Мы выяснили, что для некоторых моделей меньшее количество одновременных запросов на экземпляр является наиболее оптимальным с точки зрения пропускной способности. Благодаря этому изменению общая пропускная способность токенов в эксперименте увеличилась.

Мы также расширили парк оборудования для OpenClaw. Первые пользователи OpenClaw продолжали создавать всё больше экземпляров OpenClaw. Однако количество программных проблем с OpenClaw также увеличилось: многие экземпляры OpenClaw неправильно настраивались по запросу пользователей и в итоге оказывались в нерабочем состоянии.

T + 7 дней: подведение итогов и сокращение масштабов эксперимента.
Оглядываясь назад, спустя неделю, мы многому научились:
  • Спрос оказался намного выше, чем мы ожидали, как по количеству пользователей, так и по числу запросов и токенов на запрос. Серверы с 8 графическими процессорами доказали свою способность обрабатывать большие модели, но спрос оказался слишком высок для небольшого количества серверов, участвовавших в нашем эксперименте. Метрики также выявили некоторые узкие места в программном обеспечении, используемом для маршрутизации и обработки запросов.
  • Для устранения некоторых из этих узких мест потребуется исключить оборудование из пула, используемого для API вывода данных, чтобы протестировать некоторые изменения. Мы также рассмотрим возможность улучшения нашей документации, добавив больше подробностей и руководств, чтобы упростить ее использование для начинающих.
  • Мы также пересмотрим наш выбор LLM на основе рассмотренных нами метрик. Возможно, мы также рассмотрим другие варианты использования, такие как переранжирование или встраивание, как это используется в конвейерах RAG. Кроме того, мы критически оценим эксперимент OpenClaw и усилия, необходимые для его поддержки.
  • Эксперимент по выводу данных продолжится, но в уменьшенном масштабе: мы продолжим предоставлять доступ к небольшим моделям, таким как Qwen 3.6 и 3.8, но сделаем перерыв в предоставлении доступа к большим моделям.

Попробуйте сами на experiments.hetzner.com Мы продолжим запускать новые проекты и экспериментировать, чтобы увидеть, что еще возможно. Следите за обновлениями, чтобы узнать, что будет дальше.
Выделенные серверы OVH
Выделенные серверы Hetzner

0 комментариев

Оставить комментарий