Exercícios
Avalie seus conhecimentos sobre detecção de anomalias com Machine Learning neste questionário prático. Explore conceitos fundamentais para identificar observações incomuns, outliers e padrões anômalos em diferentes tipos de dados. As questões abordam escore z, distância, padronização de variáveis, boxplots e os efeitos da alta dimensionalidade. Você também testará sua compreensão de algoritmos como Isolation Forest, Local Outlier Factor (LOF), One-Class SVM e autoencoders, incluindo parâmetros como contaminação e nu. Além disso, o quiz trata de métricas de avaliação, matriz de confusão, precisão, revocação, curva precisão-revocação, escolha de limiares, validação em séries temporais, anomalias coletivas e monitoramento de drift após a implantação do modelo.
Responda às questões abaixo e confira a explicação de cada resposta.
0/18 respondidas
Áudio automático ativado: as próximas questões serão lidas ao clicar em Continuar.
Uma anomalia é uma observação que se desvia significativamente do padrão esperado. Ela pode representar fraude, falha, evento raro ou erro, dependendo do contexto.
Em uma distribuição normal, valores com |z| > 3 são raros e podem ser investigados como anomalias. A regra é uma heurística, não uma decisão universal.
O Isolation Forest cria divisões aleatórias dos dados. Como anomalias tendem a ser raras e diferentes, geralmente são isoladas com menos divisões e apresentam menor caminho médio nas árvores.
O LOF compara a densidade local de cada observação com a de seus vizinhos. Uma densidade muito menor que a da vizinhança pode indicar uma anomalia local.
O ponto P está distante da região de maior densidade e de seus vizinhos mais próximos. Por isso, um método baseado em distância tende a atribuir a ele maior grau de anomalia.
Sem padronização, uma variável medida em milhares pode dominar outra medida entre zero e um. Isso distorce distâncias e vizinhanças usadas por algoritmos como k-NN e LOF.
A contaminação representa a proporção esperada de observações anômalas e costuma ajudar a definir o limiar que separa casos normais de casos sinalizados.
A precisão é VP/(VP+FP). Com 18 verdadeiros positivos e 2 falsos positivos, temos 18/(18+2) = 0,90, ou 90%.
A PR-AUC concentra-se no desempenho da classe positiva rara e no compromisso entre precisão e revocação. A acurácia pode parecer alta mesmo quando quase nenhuma anomalia é detectada.
Uma divisão cronológica preserva a ordem temporal e simula o uso real do modelo. Embaralhar pode permitir que informações futuras vazem para o treinamento.
No Isolation Forest, caminhos menores indicam que a observação foi isolada com facilidade. Assim, o ponto P tende a receber um grau de anomalia maior que Q.
No One-Class SVM, nu funciona como limite superior para a fração de erros de treinamento e limite inferior para a fração de vetores de suporte.
O limiar deve ser ajustado na validação, considerando o custo de falsos positivos e falsos negativos. Usar o teste para ajustá-lo gera uma avaliação excessivamente otimista.
O intervalo interquartil é 18 − 10 = 8. O limite superior é Q3 + 1,5 × IQR, portanto 18 + 12 = 30.
Em muitas dimensões, distâncias entre pares de pontos podem se tornar relativamente semelhantes. Esse efeito dificulta separar observações normais de anômalas apenas pela distância.
Um autoencoder treinado em dados normais aprende a reconstruir esses padrões. Entradas muito diferentes podem gerar erro de reconstrução elevado e ser sinalizadas como anomalias.
Uma anomalia coletiva ocorre quando uma sequência é anormal em conjunto, ainda que cada ponto, analisado isoladamente, pareça aceitável.
A mudança na distribuição pode indicar deriva de dados ou de conceito. É necessário monitorá-la, investigar sua causa e, quando apropriado, recalibrar ou retreinar o detector.
Milhares de cursos online em vídeo, ebooks e áudiobooks.
Para testar seus conhecimentos no decorrer dos cursos online
Gerado diretamente na galeria de fotos do seu celular e enviado ao seu e-mail
Baixe nosso aplicativo pelo QR Code ou pelos links abaixo:.
+ de 10 milhões
de alunos
Certificado grátis e
válido em todo o Brasil
60 mil exercícios
gratuitos
4,8/5 classificação
nas lojas de apps
Cursos gratuitos em
vídeo, ebooks e audiobooks