@neuraldeep TG
Сижу перевекторизирую 235 млн сообщений с miniLM на bge-m3
Данные уже в opensearch, модель поднята на A100, казалось бы — запусти скрипт и иди спать
Но нет. ML кластер с A100 в одном сегменте сети, opensearch в другом, я со своим ноутом на корпоративном VPN в третьем. Скрипт надо запихать поближе к данным а доступов нет. Сказка да и только, буду пробиваться через техподдержку
Это ещё до того как я посчитал что встроенный ingest pipeline opensearch гоняет документы по одному — каждый = отдельный HTTP запрос к модели. 235 млн × 25ms = 68 дней. Но может я ошибаюсь и кто-то подскажет как правильно? Может как скролл настроить правильно?
Написал внешний скрипт с батчингом 3000 docs/s (воу), 21 час вместо 68 дней. Осталось его доставить туда где он сможет достучаться до обоих сервисов одновременно с минимальной задержкой
По пути vLLM v0.18.0 тихо убрал --task embed (узнал через краш в 2 ночи), потом CUDA graphs баг в RoBERTa который попал в релиз раньше фикса. A100 80GB при этом занята на 8.7 из 80 что смешно — тестами с клодом пришёл к тому что 5 контейнеров vLLM это максимум для утилизации GPU, поставил traefik перед ними для балансировки
Реалии корпоративного AI/LLM/ML зоопарка (расскажу как-нибудь в следующих постах про это)
Вот из таких историй и складывается реальный ML на проде не из красивых архитектурных схем а из сетевых сегментов, крашей в 2 ночи и 68 дней которые надо превратить в 21 час
В прошлом году на Data Fusion подсмотрел как ребята тренят классификаторы на катбусте под гарды — вернулся и собрал свой guardrails v2 на этом подходе. Сэкономил недели которые бы потратил на эксперименты с архитектурой
В этом году иду за кейсами по массивным ML пайплайнам потому что вот это всё с переиндексацией 235 млн документов явно не последний раз
И в этом году Data Fusion 2026 сделали аж более 70 сессий, ИИ-агенты, RL, CV, NLP, робототехника, рекомендательные системы, AI в кибербезопасности и науке. ML-лиды, DS, инженеры, исследователи и бизнес на одной площадке, спикеры из ВТБ, AIRI, МФТИ, Сколтеха, Яндекса, X5, Ростелекома
Я планирую приехать, если кто тоже будет пишите, пересечёмся поговорим про этот вот все =)
Данные уже в opensearch, модель поднята на A100, казалось бы — запусти скрипт и иди спать
Но нет. ML кластер с A100 в одном сегменте сети, opensearch в другом, я со своим ноутом на корпоративном VPN в третьем. Скрипт надо запихать поближе к данным а доступов нет. Сказка да и только, буду пробиваться через техподдержку
Это ещё до того как я посчитал что встроенный ingest pipeline opensearch гоняет документы по одному — каждый = отдельный HTTP запрос к модели. 235 млн × 25ms = 68 дней. Но может я ошибаюсь и кто-то подскажет как правильно? Может как скролл настроить правильно?
Написал внешний скрипт с батчингом 3000 docs/s (воу), 21 час вместо 68 дней. Осталось его доставить туда где он сможет достучаться до обоих сервисов одновременно с минимальной задержкой
По пути vLLM v0.18.0 тихо убрал --task embed (узнал через краш в 2 ночи), потом CUDA graphs баг в RoBERTa который попал в релиз раньше фикса. A100 80GB при этом занята на 8.7 из 80 что смешно — тестами с клодом пришёл к тому что 5 контейнеров vLLM это максимум для утилизации GPU, поставил traefik перед ними для балансировки
Реалии корпоративного AI/LLM/ML зоопарка (расскажу как-нибудь в следующих постах про это)
Вот из таких историй и складывается реальный ML на проде не из красивых архитектурных схем а из сетевых сегментов, крашей в 2 ночи и 68 дней которые надо превратить в 21 час
В прошлом году на Data Fusion подсмотрел как ребята тренят классификаторы на катбусте под гарды — вернулся и собрал свой guardrails v2 на этом подходе. Сэкономил недели которые бы потратил на эксперименты с архитектурой
В этом году иду за кейсами по массивным ML пайплайнам потому что вот это всё с переиндексацией 235 млн документов явно не последний раз
И в этом году Data Fusion 2026 сделали аж более 70 сессий, ИИ-агенты, RL, CV, NLP, робототехника, рекомендательные системы, AI в кибербезопасности и науке. ML-лиды, DS, инженеры, исследователи и бизнес на одной площадке, спикеры из ВТБ, AIRI, МФТИ, Сколтеха, Яндекса, X5, Ростелекома
Я планирую приехать, если кто тоже будет пишите, пересечёмся поговорим про этот вот все =)
⭐ 2 👍 34 🔥 25 💯 6 ❤️ 5 🤯 3