Acessibilidade:Áudio:1,0×
Capacitação DigitalPrograma Nacional — Moçambique
Módulo 1 de 3 · Introdução à Inteligência Artificial

Fundamentos de Inteligência Artificial

Progresso neste dispositivo0/4

Dados, algoritmos e modelos

  • Texto: disponível
  • Síntese em leitura fácil: disponível
  • Leitura em voz alta pelo navegador: disponível
  • Alto contraste e navegação por teclado: controlos disponíveis
  • Vídeo e legendagem: por produzir
  • Língua de Sinais Moçambicana: por produzir
  • Revisão de acessibilidade por terceiros: por realizar

Os controlos de acessibilidade existem e funcionam. Isso não equivale a uma revisão de acessibilidade feita por terceiros: essa revisão está proposta e ainda não foi realizada.

Duração prevista: 120 minutos, em sessão presencial.

Todos os casos, nomes, instituições e números usados nesta lição são fictícios e servem apenas de exercício.

Como o tempo desta lição está distribuído

  • Acolhimento e objectivos: 10 minutos.
  • Exposição: 35 minutos.
  • Actividade prática: 60 minutos.
  • Partilha e síntese: 15 minutos.

Como trabalhamos na sala: recomenda-se um computador por pessoa. Quando não for possível, no máximo duas pessoas por computador, alternando quem executa a meio da actividade, de modo que ambas façam. Na partilha apresentam apenas dois grupos, com tempo limitado; os restantes entregam por escrito e recebem comentário do formador. Marcar a lição como concluída é registo de aprendizagem e não é registo de assiduidade.

Objectivos da lição

  • Distinguir, com exemplos do conjunto fornecido, característica de rótulo, e algoritmo de modelo.
  • Identificar pelo menos cinco problemas no mini-conjunto de dados fornecido e classificar cada um como qualidade, representatividade, privacidade ou vazamento de dados.
  • Descrever, por palavras próprias, para que serve cada um dos conjuntos de treino, validação e teste, e o que é a inferência.
  • Propor, para cada problema identificado, uma correcção concreta antes de o conjunto ser usado.

Explicação

Nesta lição olhamos para a matéria-prima. Sem dados não há aprendizagem automática, e a maior parte dos problemas que aparecem nos sistemas não nasce do método: nasce dos dados.

Comecemos pelo vocabulário. Cada linha de uma tabela é um caso, por exemplo um pedido de licença. Cada coluna que descreve o caso é uma característica: o distrito, o número de dias que o pedido esperou, se os documentos estavam completos. A coluna que queremos prever chama-se rótulo: no nosso exemplo, se o pedido foi devolvido ou não. Treinar um sistema é mostrar-lhe muitos casos com as características e o rótulo já conhecido, para que ele encontre relações entre uns e outro.

Algoritmo e modelo não são a mesma coisa, e a confusão entre os dois gera mal-entendidos. O algoritmo é o procedimento de aprendizagem: o conjunto de passos que percorre os dados e ajusta números. O modelo é o resultado desse procedimento: o objecto já treinado, com os números ajustados, que se aplica a casos novos. Uma comparação útil: o algoritmo é a receita e o processo de cozinhar; o modelo é o prato que saiu. A mesma receita, com ingredientes diferentes, dá pratos diferentes.

A qualidade dos dados é a primeira coisa a verificar, e verifica-se a olho antes de qualquer cálculo. Valores em falta, valores impossíveis — uma idade de 187 anos, um prazo de menos três dias —, a mesma informação escrita de várias maneiras («Muanzo», «muanzo», «Muanzo Sede»), linhas duplicadas, datas trocadas. Nada disto exige saber programar para ser detectado. Exige ler a tabela.

A representatividade é um problema diferente e mais traiçoeiro, porque os dados podem estar tecnicamente correctos e ainda assim não servirem. Se nove em cada dez registos vierem de um único distrito, o modelo aprende sobretudo esse distrito e comporta-se pior nos outros — mas os números da avaliação global podem parecer bons, porque também os casos de teste vêm quase todos do mesmo sítio. A pergunta a fazer é sempre: quem está a mais e quem está a menos nesta tabela, comparado com as pessoas que o serviço realmente atende?

O vazamento de dados é o erro mais embaraçoso, porque produz resultados excelentes e falsos. Acontece quando entra no treino uma informação que, na vida real, só existe depois de o resultado ser conhecido. Se a tabela tiver uma coluna «data de emissão da licença», o modelo descobre imediatamente que quem tem data de emissão foi deferido, e acerta quase sempre — mas no momento em que o pedido dá entrada essa coluna está vazia, e o modelo é inútil. Também há vazamento quando os mesmos casos aparecem no treino e no teste: o sistema é avaliado com perguntas cuja resposta já viu.

Para evitar iludirmo-nos, os dados dividem-se em três partes, antes de começar. O conjunto de treino é onde o modelo aprende. O conjunto de validação serve para comparar alternativas e afinar escolhas, ainda durante o desenvolvimento. O conjunto de teste fica guardado, intocado, e usa-se uma única vez no fim, para estimar o desempenho com casos que o sistema nunca viu. Depois disto tudo vem a inferência, que é simplesmente o uso: dar ao modelo já treinado um caso novo e receber a saída. Treino e inferência são momentos diferentes — no dia-a-dia do serviço acontece inferência, não treino.

Uma palavra sobre privacidade, que se desenvolve no módulo 2 e já obriga aqui. Um conjunto de dados para formação ou para ensaio não precisa de nomes, números de identificação, moradas nem contactos. O princípio prático é recolher e conservar apenas o que é necessário para o fim em causa. Nesta aula, e em todas as actividades deste curso, trabalhamos exclusivamente com dados inventados. Sobre o enquadramento legal aplicável em Moçambique, quem responde é a área jurídica da instituição; este curso não dá pareceres jurídicos.

Caso fictício — a tabela que a Direcção de Muanzo quer usar

A Direcção Distrital Fictícia de Muanzo quer um sistema que avise, logo à entrada, quando um pedido de licença tem risco elevado de ser devolvido por falta de documentos. Pediu ao sector de informática a tabela dos pedidos do ano passado.

O que chegou foi um ficheiro exportado à pressa, com dez linhas de amostra para começar. A técnica responsável imprimiu a amostra e sentou-se a lê-la antes de mandar seguir. Fez bem: numa tabela de dez linhas encontrou problemas suficientes para travar o trabalho.

A amostra está a seguir, completa. Repare-se que há uma coluna «resultado», que é o rótulo, e uma coluna «data de emissão da licença», que só é preenchida depois de a decisão estar tomada.

Mini-conjunto de dados fictício — dez pedidos de licença

Dados inteiramente inventados para esta aula. Nenhuma pessoa, número ou instituição é real. A tabela está completa: não é preciso programar nem consultar mais nada para fazer a actividade.

N.º do pedidoNome do requerenteIdadeDistritoDias até à decisãoDocumentos completosData de emissão da licençaResultado (rótulo)
001Amélia Fictícia Chirindza34Muanzo12sim18/02/2026deferido
002Bento Fictício Macuácua0Muanzo9sim02/03/2026deferido
003Carla Fictícia Nhantumbo4121nãodevolvido
004Duarte Fictício Sitoe29Muanzo-3sim11/03/2026deferido
005Elsa Fictícia Matola52muanzo sede17nãodevolvido
006Filipe Fictício Cossa187Muanzo14sim20/03/2026deferido
007Amélia Fictícia Chirindza34Muanzo12sim18/02/2026deferido
008Gil Fictício Muianga38Muanzo10sim25/03/2026deferido
009Hélia Fictícia Zandamela45Muanzo8sim27/03/2026deferido
010Ivo Fictício Tembe31Nhamize19nãodevolvido

Actividade prática

Trabalho em pares, com a tabela em papel — não é necessário programar nem usar computador, com 60 minutos de trabalho, seguidos de 15 minutos de partilha e síntese em plenário.

Parte A. Identifiquem na tabela pelo menos cinco problemas. Para cada um escrevam: o número da linha ou o nome da coluna onde está, o problema em uma frase, e a classificação — qualidade dos dados, representatividade, privacidade, ou vazamento de dados.

Parte B. Para cada problema identificado, escrevam a correcção concreta a fazer antes de o conjunto ser usado. A correcção tem de ser executável por quem prepara os dados; «melhorar os dados» não é uma correcção.

Parte C. Respondam em três frases: se este conjunto fosse usado tal como está, e o resultado parecesse excelente, porque é que esse excelente resultado não seria de confiança? Usem as palavras «vazamento» e «representatividade».

Parte D. Separem, numa linha cada: qual é o rótulo desta tabela; duas colunas que são características legítimas; e uma coluna que não deve entrar no treino, com a razão.

A meio do tempo, troquem quem escreve.

Produto esperado: Uma ficha por par com, no mínimo, cinco problemas identificados e classificados, uma correcção concreta para cada um, a resposta da parte C em três frases, e a separação pedida na parte D.

Como o produto é apreciado

  • Cinco ou mais problemas encontrados, com a linha ou coluna indicada.
  • Classificação correcta de pelo menos quatro deles nas quatro categorias dadas.
  • Correcções executáveis, e não intenções genéricas.
  • Na parte C, reconhecer que a coluna da data de emissão provoca vazamento e que nove em dez registos serem de um só distrito compromete a representatividade.
  • Na parte D, identificar «resultado» como rótulo e apontar pelo menos uma coluna a excluir, com razão.
  • Participação das duas pessoas do par.

Síntese em leitura fácil

  • Cada linha da tabela é um caso. Cada coluna que descreve o caso é uma característica.
  • A coluna que queremos prever chama-se rótulo.
  • O algoritmo é o procedimento que aprende. O modelo é o resultado já treinado.
  • Antes de treinar, lê-se a tabela: valores em falta, valores impossíveis, nomes escritos de várias maneiras, linhas repetidas.
  • Se quase todos os registos vierem do mesmo sítio ou do mesmo tipo de pessoa, o sistema não serve para os outros.
  • Vazamento de dados é usar no treino uma informação que só existe depois de a decisão estar tomada. Dá resultados óptimos e falsos.
  • Os dados dividem-se em treino, validação e teste. O teste fica guardado e usa-se só no fim.
  • Inferência é usar o modelo já treinado num caso novo.
  • Num conjunto de ensaio não se põem nomes nem números de identificação. Recolhe-se só o necessário.

Verificação formativa

Estas perguntas não contam para a nota final e não são perguntas do exame final. Servem para a pessoa formanda confirmar o que percebeu.

  1. Na tabela da aula, porque é que a coluna «data de emissão da licença» não pode entrar no treino de um sistema que avisa à entrada do pedido?
  2. Qual é a diferença entre algoritmo e modelo, e porque é que dois serviços podem usar o mesmo algoritmo e obter modelos com comportamentos diferentes?

Respostas comentadas da verificação formativa

As respostas abaixo pertencem às perguntas de verificação formativa desta lição. Não são perguntas nem respostas do exame final e não têm efeito na nota. Tente responder primeiro e só depois compare.

Pergunta 1. Na tabela da aula, porque é que a coluna «data de emissão da licença» não pode entrar no treino de um sistema que avisa à entrada do pedido?

Resposta: Porque essa data só existe depois de o pedido ser deferido. É vazamento de dados: o modelo acertaria quase sempre no ensaio e seria inútil no balcão, onde a coluna está vazia.

Comentário: O teste prático é sempre este: no momento em que o sistema tem de responder, esta informação já existe? Se não existe, não pode entrar no treino.

Pergunta 2. Qual é a diferença entre algoritmo e modelo, e porque é que dois serviços podem usar o mesmo algoritmo e obter modelos com comportamentos diferentes?

Resposta: O algoritmo é o procedimento de aprendizagem; o modelo é o objecto treinado que resulta desse procedimento. Com dados diferentes, o mesmo algoritmo produz modelos diferentes, porque o que o modelo aprendeu vem dos dados.

Comentário: Daqui decorre uma consequência prática: perguntar «que algoritmo usaram?» diz pouco. A pergunta útil é «com que dados foi treinado, e quem está representado nesses dados?».

Referências consultadas

Progresso apenas neste aparelho. Sem sessão iniciada com matrícula numa turma deste curso, o que marcar fica guardado só aqui e não conta para a sua formação.

Marcar uma lição como feita não regista presença, não dá aprovação nem emite certificado.

← O que é inteligência artificial