Duração prevista: 120 minutos, em sessão presencial.
Todos os casos, nomes, instituições e números usados nesta lição são fictícios e servem apenas de exercício.
Como o tempo desta lição está distribuído
- Acolhimento e objectivos: 10 minutos.
- Exposição: 35 minutos.
- Actividade prática: 60 minutos.
- Partilha e síntese: 15 minutos.
Como trabalhamos na sala: recomenda-se um computador por pessoa. Quando não for possível, no máximo duas pessoas por computador, alternando quem executa a meio da actividade, de modo que ambas façam. Na partilha apresentam apenas dois grupos, com tempo limitado; os restantes entregam por escrito e recebem comentário do formador. Marcar a lição como concluída é registo de aprendizagem e não é registo de assiduidade.
Objectivos da lição
- Distinguir, com exemplos do conjunto fornecido, característica de rótulo, e algoritmo de modelo.
- Identificar pelo menos cinco problemas no mini-conjunto de dados fornecido e classificar cada um como qualidade, representatividade, privacidade ou vazamento de dados.
- Descrever, por palavras próprias, para que serve cada um dos conjuntos de treino, validação e teste, e o que é a inferência.
- Propor, para cada problema identificado, uma correcção concreta antes de o conjunto ser usado.
Explicação
Nesta lição olhamos para a matéria-prima. Sem dados não há aprendizagem automática, e a maior parte dos problemas que aparecem nos sistemas não nasce do método: nasce dos dados.
Comecemos pelo vocabulário. Cada linha de uma tabela é um caso, por exemplo um pedido de licença. Cada coluna que descreve o caso é uma característica: o distrito, o número de dias que o pedido esperou, se os documentos estavam completos. A coluna que queremos prever chama-se rótulo: no nosso exemplo, se o pedido foi devolvido ou não. Treinar um sistema é mostrar-lhe muitos casos com as características e o rótulo já conhecido, para que ele encontre relações entre uns e outro.
Algoritmo e modelo não são a mesma coisa, e a confusão entre os dois gera mal-entendidos. O algoritmo é o procedimento de aprendizagem: o conjunto de passos que percorre os dados e ajusta números. O modelo é o resultado desse procedimento: o objecto já treinado, com os números ajustados, que se aplica a casos novos. Uma comparação útil: o algoritmo é a receita e o processo de cozinhar; o modelo é o prato que saiu. A mesma receita, com ingredientes diferentes, dá pratos diferentes.
A qualidade dos dados é a primeira coisa a verificar, e verifica-se a olho antes de qualquer cálculo. Valores em falta, valores impossíveis — uma idade de 187 anos, um prazo de menos três dias —, a mesma informação escrita de várias maneiras («Muanzo», «muanzo», «Muanzo Sede»), linhas duplicadas, datas trocadas. Nada disto exige saber programar para ser detectado. Exige ler a tabela.
A representatividade é um problema diferente e mais traiçoeiro, porque os dados podem estar tecnicamente correctos e ainda assim não servirem. Se nove em cada dez registos vierem de um único distrito, o modelo aprende sobretudo esse distrito e comporta-se pior nos outros — mas os números da avaliação global podem parecer bons, porque também os casos de teste vêm quase todos do mesmo sítio. A pergunta a fazer é sempre: quem está a mais e quem está a menos nesta tabela, comparado com as pessoas que o serviço realmente atende?
O vazamento de dados é o erro mais embaraçoso, porque produz resultados excelentes e falsos. Acontece quando entra no treino uma informação que, na vida real, só existe depois de o resultado ser conhecido. Se a tabela tiver uma coluna «data de emissão da licença», o modelo descobre imediatamente que quem tem data de emissão foi deferido, e acerta quase sempre — mas no momento em que o pedido dá entrada essa coluna está vazia, e o modelo é inútil. Também há vazamento quando os mesmos casos aparecem no treino e no teste: o sistema é avaliado com perguntas cuja resposta já viu.
Para evitar iludirmo-nos, os dados dividem-se em três partes, antes de começar. O conjunto de treino é onde o modelo aprende. O conjunto de validação serve para comparar alternativas e afinar escolhas, ainda durante o desenvolvimento. O conjunto de teste fica guardado, intocado, e usa-se uma única vez no fim, para estimar o desempenho com casos que o sistema nunca viu. Depois disto tudo vem a inferência, que é simplesmente o uso: dar ao modelo já treinado um caso novo e receber a saída. Treino e inferência são momentos diferentes — no dia-a-dia do serviço acontece inferência, não treino.
Uma palavra sobre privacidade, que se desenvolve no módulo 2 e já obriga aqui. Um conjunto de dados para formação ou para ensaio não precisa de nomes, números de identificação, moradas nem contactos. O princípio prático é recolher e conservar apenas o que é necessário para o fim em causa. Nesta aula, e em todas as actividades deste curso, trabalhamos exclusivamente com dados inventados. Sobre o enquadramento legal aplicável em Moçambique, quem responde é a área jurídica da instituição; este curso não dá pareceres jurídicos.
Caso fictício — a tabela que a Direcção de Muanzo quer usar
A Direcção Distrital Fictícia de Muanzo quer um sistema que avise, logo à entrada, quando um pedido de licença tem risco elevado de ser devolvido por falta de documentos. Pediu ao sector de informática a tabela dos pedidos do ano passado.
O que chegou foi um ficheiro exportado à pressa, com dez linhas de amostra para começar. A técnica responsável imprimiu a amostra e sentou-se a lê-la antes de mandar seguir. Fez bem: numa tabela de dez linhas encontrou problemas suficientes para travar o trabalho.
A amostra está a seguir, completa. Repare-se que há uma coluna «resultado», que é o rótulo, e uma coluna «data de emissão da licença», que só é preenchida depois de a decisão estar tomada.
Mini-conjunto de dados fictício — dez pedidos de licença
Dados inteiramente inventados para esta aula. Nenhuma pessoa, número ou instituição é real. A tabela está completa: não é preciso programar nem consultar mais nada para fazer a actividade.
| N.º do pedido | Nome do requerente | Idade | Distrito | Dias até à decisão | Documentos completos | Data de emissão da licença | Resultado (rótulo) |
|---|---|---|---|---|---|---|---|
| 001 | Amélia Fictícia Chirindza | 34 | Muanzo | 12 | sim | 18/02/2026 | deferido |
| 002 | Bento Fictício Macuácua | 0 | Muanzo | 9 | sim | 02/03/2026 | deferido |
| 003 | Carla Fictícia Nhantumbo | 41 | 21 | não | devolvido | ||
| 004 | Duarte Fictício Sitoe | 29 | Muanzo | -3 | sim | 11/03/2026 | deferido |
| 005 | Elsa Fictícia Matola | 52 | muanzo sede | 17 | não | devolvido | |
| 006 | Filipe Fictício Cossa | 187 | Muanzo | 14 | sim | 20/03/2026 | deferido |
| 007 | Amélia Fictícia Chirindza | 34 | Muanzo | 12 | sim | 18/02/2026 | deferido |
| 008 | Gil Fictício Muianga | 38 | Muanzo | 10 | sim | 25/03/2026 | deferido |
| 009 | Hélia Fictícia Zandamela | 45 | Muanzo | 8 | sim | 27/03/2026 | deferido |
| 010 | Ivo Fictício Tembe | 31 | Nhamize | 19 | não | devolvido |
Actividade prática
Trabalho em pares, com a tabela em papel — não é necessário programar nem usar computador, com 60 minutos de trabalho, seguidos de 15 minutos de partilha e síntese em plenário.
Parte A. Identifiquem na tabela pelo menos cinco problemas. Para cada um escrevam: o número da linha ou o nome da coluna onde está, o problema em uma frase, e a classificação — qualidade dos dados, representatividade, privacidade, ou vazamento de dados.
Parte B. Para cada problema identificado, escrevam a correcção concreta a fazer antes de o conjunto ser usado. A correcção tem de ser executável por quem prepara os dados; «melhorar os dados» não é uma correcção.
Parte C. Respondam em três frases: se este conjunto fosse usado tal como está, e o resultado parecesse excelente, porque é que esse excelente resultado não seria de confiança? Usem as palavras «vazamento» e «representatividade».
Parte D. Separem, numa linha cada: qual é o rótulo desta tabela; duas colunas que são características legítimas; e uma coluna que não deve entrar no treino, com a razão.
A meio do tempo, troquem quem escreve.
Produto esperado: Uma ficha por par com, no mínimo, cinco problemas identificados e classificados, uma correcção concreta para cada um, a resposta da parte C em três frases, e a separação pedida na parte D.
Como o produto é apreciado
- Cinco ou mais problemas encontrados, com a linha ou coluna indicada.
- Classificação correcta de pelo menos quatro deles nas quatro categorias dadas.
- Correcções executáveis, e não intenções genéricas.
- Na parte C, reconhecer que a coluna da data de emissão provoca vazamento e que nove em dez registos serem de um só distrito compromete a representatividade.
- Na parte D, identificar «resultado» como rótulo e apontar pelo menos uma coluna a excluir, com razão.
- Participação das duas pessoas do par.
Síntese em leitura fácil
- Cada linha da tabela é um caso. Cada coluna que descreve o caso é uma característica.
- A coluna que queremos prever chama-se rótulo.
- O algoritmo é o procedimento que aprende. O modelo é o resultado já treinado.
- Antes de treinar, lê-se a tabela: valores em falta, valores impossíveis, nomes escritos de várias maneiras, linhas repetidas.
- Se quase todos os registos vierem do mesmo sítio ou do mesmo tipo de pessoa, o sistema não serve para os outros.
- Vazamento de dados é usar no treino uma informação que só existe depois de a decisão estar tomada. Dá resultados óptimos e falsos.
- Os dados dividem-se em treino, validação e teste. O teste fica guardado e usa-se só no fim.
- Inferência é usar o modelo já treinado num caso novo.
- Num conjunto de ensaio não se põem nomes nem números de identificação. Recolhe-se só o necessário.
Verificação formativa
Estas perguntas não contam para a nota final e não são perguntas do exame final. Servem para a pessoa formanda confirmar o que percebeu.
- Na tabela da aula, porque é que a coluna «data de emissão da licença» não pode entrar no treino de um sistema que avisa à entrada do pedido?
- Qual é a diferença entre algoritmo e modelo, e porque é que dois serviços podem usar o mesmo algoritmo e obter modelos com comportamentos diferentes?
Respostas comentadas da verificação formativa
As respostas abaixo pertencem às perguntas de verificação formativa desta lição. Não são perguntas nem respostas do exame final e não têm efeito na nota. Tente responder primeiro e só depois compare.
Pergunta 1. Na tabela da aula, porque é que a coluna «data de emissão da licença» não pode entrar no treino de um sistema que avisa à entrada do pedido?
Resposta: Porque essa data só existe depois de o pedido ser deferido. É vazamento de dados: o modelo acertaria quase sempre no ensaio e seria inútil no balcão, onde a coluna está vazia.
Comentário: O teste prático é sempre este: no momento em que o sistema tem de responder, esta informação já existe? Se não existe, não pode entrar no treino.
Pergunta 2. Qual é a diferença entre algoritmo e modelo, e porque é que dois serviços podem usar o mesmo algoritmo e obter modelos com comportamentos diferentes?
Resposta: O algoritmo é o procedimento de aprendizagem; o modelo é o objecto treinado que resulta desse procedimento. Com dados diferentes, o mesmo algoritmo produz modelos diferentes, porque o que o modelo aprendeu vem dos dados.
Comentário: Daqui decorre uma consequência prática: perguntar «que algoritmo usaram?» diz pouco. A pergunta útil é «com que dados foi treinado, e quem está representado nesses dados?».
Referências consultadas
- OECD AI Principles — definição de sistema de inteligência artificial — https://oecd.ai/en/ai-principles (consultado em 21 de Setembro de 2026).
- NIST AI Risk Management Framework — quadro voluntário de gestão de risco — https://www.nist.gov/itl/ai-risk-management-framework (consultado em 21 de Setembro de 2026).
