hirq
← All jobs

Jusbrasil

SRE Partner

Remoto · On-site · Engenharia

Apply well, not just fast

Create a free account and upload your resume to get a match score, keyword gaps, a tailored resume, a cover letter and interview prep for this job.

About the role

SREGrafanaElasticsearchGCPKubernetesTerraformPrometheus
Você deveria fazer parte do Jusbrasil Transformar o sistema de Justiça com tecnologia não é trivial. Estamos construindo uma inteligência artificial dentro de casa: o Jus IA tem 43% menos alucinações que IAs generalistas. Essa é a prova concreta de que aqui tecnologia não é discurso, e sustenta a nossa missão: elevar a justiça. Lidamos com mais de 7 bilhões de documentos jurídicos e mais de 1.400 fontes de dados oficiais. É desafio de escala e precisão que poucas empresas no país enfrentam. Somos 670 pessoas jusbrasileiras, quase metade em engenharia e produto, espalhadas por mais de 125 cidades no Brasil e fora. O modelo é remoto: você escolhe onde viver, a vaga não muda. Aqui, quem chama pra si o problema sem dono e entrega algo acima do esperado cresce rápido. Quem prefere o caminho óbvio, não. Conheça nosso impacto - site jurídico nº1 do mundo em número de acessos - mais de 20 milhões de usuários por mês - mais de 7 bilhões de documentos jurídicos de interesse público - mais de 80% dos advogados brasileiros cadastrados - 670 pessoas jusbrasileiras, quase metade em tecnologia e produto - presença em mais de 125 cidades no Brasil e fora - modelo remoto: liberdade de escolher onde viver, sem perder a vaga certa Sobre a posição O Jusbrasil está em busca de uma pessoa Senior Site Reliability Engineer para atuar como SRE Partner — um papel estratégico criado para aproximar a engenharia de confiabilidade das Áreas de Produto (PAs) onde o impacto é mais direto. A peça central da nossa engenharia é a Agentic Engineering Platform — uma plataforma onde desenvolvedores declaram intenção e agentes de IA abstraem a complexidade de infraestrutura, reduzindo carga cognitiva e acelerando a entrega. O SRE Partner é o elo humano entre essa plataforma e os times de produto: a pessoa que entende as dores reais de cada PA, implementa a agenda de SRE no dia a dia dos times e garante a adoção dos recursos da plataforma onde eles mais importam. Essa posição atua de forma alocada nas PAs prioritárias com foco em elevar a maturidade de confiabilidade de cada time, reduzir riscos operacionais e construir uma cultura orientada a dados, SLOs e resposta a incidentes. Quem ocupa esse papel não apenas diagnostica problemas: vende soluções, influencia decisões e age como embaixador da plataforma de engenharia. Desafios da posição - Ser alocada em PAs críticas e ganhar rapidamente contexto das suas dores, riscos e arquitetura, iniciando entregas de alto impacto nos primeiros meses. - Implementar a agenda de SRE nas PAs: definição de SLOs, estruturação de on-call, runbooks, gestão de incidentes e post-mortems. - Construir e evoluir uma matriz de maturidade de SRE para cada PA, mapeando o estado atual e definindo o caminho de evolução. - Identificar riscos operacionais — pontos únicos de falha, serviços sem dono, alertas ruidosos — e atuar proativamente para eliminá-los antes que virem incidentes. - Ser o embaixador da Agentic Engineering Platform nas PAs: promover a adoção de Golden Paths, canary deployments, feature flags, dashboards automatizados e demais recursos da plataforma. - Trabalhar próxima dos times de produto para garantir que as práticas de SRE sejam parte do fluxo natural de desenvolvimento — e não um processo paralelo. - Levantar dados e gerar insights acionáveis sobre disponibilidade, latência, toil e uso de infraestrutura para orientar decisões nas PAs. Responsabilidades - Garantir confiabilidade, disponibilidade e escalabilidade dos sistemas e serviços das PAs onde estiver alocada. - Desenvolver e implementar soluções de monitoramento, observabilidade e alertas integradas à Agentic Engineering Platform. - Apoiar os times na definição e acompanhamento de SLIs, SLOs e error budgets. - Estruturar e evoluir a gestão de on-call nas PAs: rotação, escalation, ferramental de acionamento e gestão de incidentes. - Trabalhar em estreita colaboração com a Engineering Platform para garantir que os recursos da plataforma cheguem e sejam adotados nos times de produto. - Contribuir ativamente para a evolução da Agentic Engineering Platform, trazendo feedback real das PAs sobre fricções, gaps e oportunidades de melhoria. - Participar e influenciar a construção de uma cultura de engenharia orientada à confiabilidade (SRE) em toda a empresa. - Apoiar migrações de sistemas críticos, segregação de ambientes e deprecation de tecnologias legadas. Requisitos - Experiência com ambientes em nuvem, preferencialmente GCP. - Proficiência em ferramentas e práticas de observabilidade (Prometheus, Grafana, Loki, Thanos, Elasticsearch, AlertManager etc.). - Sólido conhecimento em Kubernetes e arquitetura distribuída. - Sólido conhecimento de infraestrutura como código (IaC) e Terraform. - Experiência prática com gestão de incidentes, on-call e post-mortems. - Experiência com definição e acompanhamento de SLOs e error budgets. - Capacidade de análise de logs e desempenho de sistemas distribuídos. - Forte habilidade de comunicação e influência: saber vender soluções técnicas para audiências diversas — engenheiros, PMs e lideranças. - Visão data-driven, usando dados para mapear riscos, priorizar ações e demonstrar impacto. Diferenciais - Experiência em ambientes multi-cloud ou empresas com grande volume de acesso. - Experiência em desenvolvimento de software e boas práticas de engenharia de produto. - Vivência anterior em papel de SRE embedded ou alocado em times de produto. - Contribuições relevantes em projetos de observabilidade, redução de toil ou automação de operações. - Familiaridade com conceitos de plataformas de engenharia (Internal Developer Platforms, Golden Paths, Developer Experience). - Experiência com ferramentas de gestão de incidentes como **incident.io ou Grafana IRM**.