Produtividade com IA: o que medir antes de comemorar

Todo mundo fala em "30% mais produtividade com IA". Poucos medem.

Nos últimos anos saíram estudos sérios sobre IA no desenvolvimento de software. E eles não concordam entre si:

→ Num experimento controlado do GitHub, quem usou Copilot terminou a mesma tarefa 55,8% mais rápido.
→ Em três experimentos de campo com 4.867 desenvolvedores, a alta foi de 26% nas tarefas concluídas.
→ Um estudo da Microsoft com mais de 16 mil engenheiros observou 40,5% mais PRs nas semanas de uso intenso.
→ E um experimento do METR com devs experientes mediu o contrário: 19% mais lentos com IA. Detalhe: eles próprios achavam que estavam 20% mais rápidos.

A lição não é "IA funciona" nem "IA não funciona". É que a percepção do time não é métrica.

Antes de comemorar qualquer número, eu olharia para quatro coisas:

  1. Baseline. O mesmo time, antes, medido do mesmo jeito.
  2. Fluxo, não volume. Lead time e frequência de deploy dizem mais do que linhas de código ou quantidade de PRs.
  3. Estabilidade junto. O relatório DORA de 2024 associou mais adoção de IA a queda de throughput e de estabilidade de entrega. Velocidade que aumenta retrabalho não é ganho.
  4. Experiência de quem desenvolve. Carga cognitiva e tempo de foco mostram se o ganho se sustenta ou se vai virar esgotamento.

IA no ciclo de desenvolvimento é investimento. E investimento se mede como investimento: antes, depois e com o custo junto.

Como vocês estão medindo isso nos seus times?