МТС
Lead Product SRE в Скоринг [Big Data, МТС Веб Сервисы]
Зарплата не указана
От 3 до 6 летГибкийМосква
Навыки
HadoopClickhouseApache KafkaPrometheusVictoriaMetricsOpenTelemetryGrafanaSLASLOSLICapacity PlanningObservability
Обязанности
- 01Управлять сервисами и практиками надежности ИТ-продуктов: формировать бэклог, определять стратегию SRE для продуктов
- 02Внедрять единую методологию управления надежностью (SLA/SLO/SLI) совместно со смежными Big Data продуктами, обеспечивая сквозную стабильность инфраструктуры и приложений кластера
- 03Проектировать и развивать общие стандарты отказоустойчивости распределенных систем
- 04Лидировать кросс-продуктовые рабочие группы по надежности: внедрять создание единых стандартов мониторинга, алертинга и распределенной трассировки для Big Data инфраструктуры
- 05Управлять эффективностью использования ресурсов (Capacity Planning) высоконагруженных кластеров в масштабах всей экосистемы продуктов
- 06Выстраивать общую культуру разбора инцидентов со смежными командами, превращая аварии на стыке систем в общие инженерные практики и системные улучшения
- 07Менторить команды разработки и аналитики, помогая им проектировать сервисы с учетом нефункциональных требований и продуктовых SLO
Требования
- 01Опыт работы в роли SRE / Infrastructure / Platform Lead или Technical Product Manager (Platform) от 3 лет в крупных высоконагруженных или Big Data проектах
- 02Продуктовое мышление: умение собирать требования у внутренних клиентов (разработка, дата-инженеры), приоритизировать бэклог и оцифровывать надежность в бизнес-метрики
- 03Практический опыт выстраивания общих технических стандартов и процессов в кросс-продуктовой среде
- 04Отличное понимание специфики надежности Big Data решений и Highload-архитектуры: принципы работы аналитических БД (Hadoop, Clickhouse) распределенных брокеров (Apache Kafka), и микросервисов
- 05Экспертные знания в области построения систем сквозного наблюдаемости (Observability: Prometheus, VictoriaMetrics, OpenTelemetry, Grafana) на стыке инфраструктуры и бизнес-метрик
- 06Глубокое понимание архитектурных паттернов отказоустойчивости распределенных систем и жизненного цикла поставки ценности
- 07Сильные коммуникативные навыки: умение договариваться, защищать продуктовые метрики перед стейкхолдерами и мягко внедрять инженерные изменения
Условия
- 01собственную платформу MTS Ocean для получения ИТ-ресурсов, а это значит, что деплой, мониторинг, observability — не будут для тебя проблемой, ты сможешь сосредоточиться на фичах
- 02профессиональные гильдии инженеров, где мы поддерживаем друг друга и помогаем стать лучше
- 03внутреннюю площадку TechTalks для обмена опытом, дискуссий, развития навыков самопрезентации
- 04участие во внешних IT конференциях
- 05выступление на HighLoad++, DataFest, Mobius, Test Driven Conf, Joker, DevOps, Матемаркетинг и проведение собственной конференции по архитектуре True Tech Arch
- 06полезные курсы и вебинары в корпоративном университете и электронную библиотеку
- 07ДМС с первого месяца работы, включая стоматологию
- 08страхование от несчастных случаев с 1 месяца работы
- 09материальную помощь в сложных жизненных ситуациях
- 10отпуск 28 календарных дней
- 11прием врачей общей практики и массаж в офисе
- 12мобильная связь за счет компании и льготные тарифы для близких
- 13подписка на онлайн-кинотеатр KION, сервис МТС Музыка, книжный сервис Строки от МТС, безлимитные мессенджеры и соцсети