Data Meetup VK Tech #1: платформы данных

Data Meetup VK Tech #1: платформы данных

18 августа VK Tech проводит митап про платформы данных. И там будет интересный кейс Авито про ситуацию, когда производительность дата-платформы упирается не в движок, а в S3 🙂

Их аналитическая платформа работает на Trino и Vertica поверх Hive-каталогов, а данные лежат в S3 на HDD. Доступная конфигурация S3 уперлась в предел масштабирования и 20 ГБайт/с на чтение.

Что придумали:
🤩взяли три S3 кластера
🤩распределили объекты каждой таблицы между ними по хешу пути
🤩превратили существующие HAProxy-сайдкары на compute-нодах в stateless-шардирующий прокси
🤩каждая нода стала сразу ходить в нужный S3 без отдельного proxy layer

В итоге пиковую скорость чтения увеличили с 20 до 60 ГБайт/с🚀

На митапе Дмитрий Листвин из Авито расскажет, как они писали расширение HAProxy на Lua, реализовали ListObjects и DeleteObjects, какие проблемы собрали и как теперь решардируют и эксплуатируют эту конструкцию.

Еще будет доклад Павла Кутакова из VK Tech про архитектуру VK Data Platform гиперконвергентной дата-платформы на k8s: управление СУБД и сервисами, отказоустойчивость, сеть, безопасность и наблюдаемость.

А после инженеры RWB и VK Tech разберут подготовку сегментов для таргетинга на Trino и DataFusion и обсудят, как AI-агенты и новые типы нагрузок изменят платформы данных.

И куда же без нетворкинга, пиццы🍕 и приятных напитков 🍺

📅 18 августа, сбор в 17:30
📍 Москва, БЦ «Скайлайт»
💻 Можно подключиться онлайн

Войти

Зарегистрироваться

Сбросить пароль

Пожалуйста, введите ваше имя пользователя или эл. адрес, вы получите письмо со ссылкой для сброса пароля.