MLModels: visão computacional em notebooks
Sumário
Conjunto de experimentos em visão computacional com redes neurais convolucionais (CNNs) aplicadas aos datasets CIFAR-10 e Fashion-MNIST, cobrindo treinamento, ajuste de hiperparâmetros e pipelines de inferência.
Visão geral
O repositório MLModels reúne implementações de classificação supervisionada de imagens utilizando TensorFlow e Keras. Os experimentos cobrem arquiteturas convolucionais aplicadas aos conjuntos de dados CIFAR-10 e Fashion-MNIST, estruturando as rotinas de pré-processamento de tensores, regularização de modelos e métricas de convergência.
Cada notebook registra as decisões de engenharia adotadas durante o treinamento, incluindo taxas de aprendizado, curvas de perda e matrizes de confusão detalhadas por classe.
Arquiteturas e conjuntos de dados
CIFAR-10
O experimento processa 60.000 imagens coloridas em resolução de 32x32 pixels distribuídas em dez categorias de objetos e animais.
- Arquitetura da rede. Blocos sequenciais com camadas
Conv2D(filtros 3x3 e ativação ReLU),MaxPooling2Dpara redução de dimensionalidade espacial eDropoutpara controle de sobreajuste (overfitting). - Camada densa. Camadas totalmente conectadas com regularização e camada final
Densecom ativaçãoSoftmaxde dez saídas. - Otimização. Função de perda
sparse_categorical_crossentropy, otimizador Adam com decaimento de taxa de aprendizado e parada antecipada (early stopping) monitorando a perda na validação.
Fashion-MNIST
O experimento classifica 70.000 imagens em escala de cinza em resolução de 28x28 pixels correspondentes a dez tipos de peças de vestuário.
- Pré-processamento. Normalização de canais com valores de ponto flutuante no intervalo [0, 1] e conversão para o formato dimensional esperado pela biblioteca Keras.
- Topologia. Camadas convolucionais compactas otimizadas para convergência rápida em dados monocromáticos, seguidas de achatamento (flattening) e classificação densa.
- Teste de inferência. Pipeline de pós-processamento que recebe imagens externas em formatos convencionais, executa redimensionamento bilinear, conversão para matriz de canal único e retorna as probabilidades por classe.
Avaliação e diagnóstico de modelos
O diagnóstico dos modelos baseia-se em métricas segmentadas por classe. Além da acurácia global na partição de teste, os notebooks geram matrizes de confusão para identificar sobreposição de padrões entre categorias semelhantes (como camisas e camisetas em Fashion-MNIST, ou gatos e cachorros em CIFAR-10).
O pipeline de inferência implementa verificações de contrato de entrada para dimensões de tensor, canais de cor e escala de normalização, garantindo consistência entre a fase de treino e as requisições em tempo de execução.