Treinar e versionar
Circuitos de treino reproduzíveis, com dados, código e parâmetros versionados: cada modelo tem um registo de linhagem desde o primeiro dia.
/ TI e dados /
Treino versionado, deploy, monitorização e rollback para modelos de IA—entregues como uma plataforma que a sua equipa de ciência de dados quer mesmo usar.
O problema
A ciência de dados entrega um notebook, a engenharia reescreve-o para produção e a lógica original das variáveis desvia-se pelo caminho. A maioria dos pilotos morre em silêncio nessa passagem.
As versões vivem em nomes de pasta e em mensagens de Slack. Quando algo se parte, ninguém tem a certeza de qual é o modelo que está em produção nem com que dados foi treinado.
Vigia-se a latência e o CPU; o desvio, a degradação do desempenho e as quedas por segmento notam-se quando alguém do negócio se queixa.
Reverter um modelo significa uma sala de crise, uma reimplementação à mão e uma análise pós-incidente que ninguém aprecia. Não existe um caminho de retrocesso a sério.
Como funciona
Circuitos de treino reproduzíveis, com dados, código e parâmetros versionados: cada modelo tem um registo de linhagem desde o primeiro dia.
Implementação num só comando, com tráfego em sombra, canário e A/B, para que as versões novas se provem antes de receber tráfego real.
Verificações de desvio, de desempenho e por segmento, com alertas automáticos e retrocesso num clique para uma versão que se sabe boa.
A plataforma adapta-se à vossa nuvem, aos frameworks de modelos e ao stack de dados que já têm.
O que inclui
Treino, registo de modelos, implementação, monitorização e retrocesso, entregues sobre Synapse como uma só camada de operação para a ciência de dados e para a engenharia de ML.
Circuitos reproduzíveis, com dados, código e parâmetros versionados: cada execução fica registada na linhagem.
Um registo central com versões, promoção entre etapas, responsáveis e pontos de aprovação entre pré-produção e produção.
Implementação em lote, em tempo real e incorporada, num só comando, com paridade entre ambientes e infraestrutura como código.
Desvio nas entradas, desvio nas previsões e desempenho ao nível do resultado, com detalhe por segmento e responsáveis identificados para cada alerta.
Corram as versões novas em sombra sobre tráfego real, façam testes A/B com salvaguardas estatísticas e promovam as vencedoras em segurança.
Retrocesso num clique para a versão anterior que se sabe boa, com registo de auditoria completo e atribuição do incidente.
Funciona sobre Synapse
Resultados
Os resultados variam com o contexto, a maturidade dos dados e o âmbito. Delimitamos com honestidade antes de prometer com precisão.
5–10x
Mais modelos a chegar a produção em cada trimestre
Orientativo — depende da maturidade de partida e do tamanho da equipa.
Minutos
Para publicar uma versão nova de um modelo, quando antes eram dias
Orientativo — a partir de equipas que já têm a plataforma.
Vigiados
Desvio, desempenho e retrocesso em cada modelo em produção
Como trabalhamos
Semanas 1-2
Inventariamos os modelos atuais, as dores de implementação, as falhas de monitorização e o que a plataforma tem de dar.
Semanas 3-5
Definimos o modelo de registo, os padrões de implementação, os contratos de monitorização e a política de retrocesso, com a ciência de dados e a engenharia.
Semanas 6-12
Montamos treino, registo, implementação e monitorização, e provamos tudo num primeiro modelo real em produção.
Semana 13 em diante
Incorporamos mais equipas e mais modelos, ampliamos a cobertura da monitorização e operamos a plataforma como serviço.
Os prazos variam com o número de modelos, a diversidade de frameworks e a infraestrutura que já existe.
Ideas, trends, and tools to stay ahead
Começar
Sem compromisso. Começamos com uma sessão delimitada para mapear os vossos modelos, as falhas e o que a plataforma precisa de ter.