Comprensión del problema

Conser-vision Practice Area: Image Classification

En este proyecto se abordará la competición Conser-vision Practice Area: Image Classification, organizada por DrivenData, cuyo objetivo consiste en desarrollar un modelo de Visión por Computador capaz de identificar automáticamente diferentes especies animales a partir de imágenes capturadas mediante cámaras trampa instaladas en el Parque Nacional de Taï, en África Occidental.

Contexto del problema

Las cámaras trampa se han convertido en una herramienta imprescindible para el estudio y la conservación de la fauna salvaje. Estos dispositivos permanecen instalados durante largos periodos de tiempo y capturan fotografías automáticamente cuando detectan movimiento o cambios de temperatura.

Gracias a este sistema es posible monitorizar poblaciones animales sin interferir en su comportamiento natural. Sin embargo, esta ventaja también genera un importante desafío: la enorme cantidad de imágenes producidas.

Un único proyecto de conservación puede generar cientos de miles o incluso millones de fotografías, muchas de ellas sin animales o con especies difíciles de identificar. Revisar manualmente todas estas imágenes supone miles de horas de trabajo para los investigadores.

La aplicación de técnicas de Inteligencia Artificial permite automatizar gran parte de este proceso, acelerando el análisis de los datos y facilitando el estudio de los ecosistemas.

Problema a resolver

El objetivo del proyecto consiste en desarrollar un modelo de clasificación de imágenes capaz de identificar correctamente la especie presente en cada fotografía obtenida por las cámaras trampa.

Cada imagen deberá clasificarse en una de las siguientes categorías:

  • Antelope Duiker
  • Bird
  • Blank (sin animales)
  • Civet Genet
  • Hog
  • Leopard
  • Monkey Prosimian
  • Rodent

Una característica especialmente interesante de esta competición es que las imágenes del conjunto de prueba proceden de ubicaciones completamente diferentes a las utilizadas durante el entrenamiento. Esto obliga al modelo a aprender las características propias de cada especie en lugar de memorizar el entorno donde fue capturada la fotografía.

Objetivos del proyecto

El objetivo principal consiste en desarrollar un modelo de Deep Learning capaz de clasificar automáticamente las especies presentes en las imágenes con un elevado nivel de precisión y una buena capacidad de generalización.

Para ello se plantean los siguientes objetivos específicos:

  • Comprender la estructura del conjunto de datos.
  • Analizar las características visuales de las diferentes especies.
  • Diseñar un proceso adecuado de preparación de imágenes.
  • Aplicar técnicas de Transfer Learning utilizando modelos preentrenados.
  • Evaluar diferentes arquitecturas de Visión por Computador.
  • Optimizar el rendimiento del modelo mediante técnicas de aumento de datos.
  • Generar predicciones compatibles con el formato requerido por la competición.

Criterios de éxito

El éxito del proyecto no dependerá únicamente de obtener una buena posición en la clasificación de la competición.

También se considerarán los siguientes aspectos:

  • Desarrollar un pipeline completamente reproducible.
  • Documentar todas las fases del proyecto.
  • Aplicar una metodología estructurada de Ciencia de Datos.
  • Obtener un modelo con buena capacidad de generalización sobre nuevas localizaciones.
  • Publicar el proyecto completo como recurso educativo para otros profesionales y estudiantes.

Partes interesadas

Aunque el proyecto se desarrolla dentro de una competición de Ciencia de Datos, la solución tiene aplicaciones reales y beneficia a diferentes grupos de interés.

Los principales beneficiarios son los investigadores dedicados a la conservación de la biodiversidad, que podrán reducir significativamente el tiempo necesario para clasificar las imágenes obtenidas mediante cámaras trampa.

Las organizaciones dedicadas a la protección del medio ambiente también podrán utilizar este tipo de modelos para mejorar el seguimiento de poblaciones animales y acelerar el análisis de grandes volúmenes de información.

Finalmente, este proyecto constituye un caso práctico de aplicación de técnicas modernas de Deep Learning y Visión por Computador, por lo que también resulta de interés para estudiantes y profesionales del ámbito de la Inteligencia Artificial.

Restricciones del proyecto

La competición establece una serie de limitaciones que deben respetarse durante el desarrollo del modelo.

No está permitido utilizar conjuntos de datos externos para el entrenamiento, por lo que únicamente podrán emplearse las imágenes proporcionadas por la organización.

Asimismo, las predicciones deberán generarse siguiendo exactamente el formato especificado por la competición y el rendimiento del modelo se evaluará mediante la métrica Multi-class Log Loss.

Riesgos

Durante el desarrollo del proyecto pueden aparecer diferentes dificultades que afecten al rendimiento del modelo.

Entre los principales riesgos destacan:

  • Desbalance entre las diferentes clases.
  • Sobreajuste al fondo de las imágenes.
  • Baja capacidad de generalización entre distintas ubicaciones.
  • Variaciones importantes en iluminación y condiciones meteorológicas.
  • Imágenes nocturnas obtenidas mediante infrarrojos.
  • Animales parcialmente ocultos por la vegetación.
  • Fotografías donde no aparece ningún animal.

Todos estos aspectos deberán analizarse durante las siguientes fases del proyecto para diseñar un modelo robusto y capaz de enfrentarse a escenarios reales.

Alcance del proyecto

Este proyecto se centra exclusivamente en la clasificación automática de especies animales presentes en imágenes individuales.

Quedan fuera del alcance tareas más complejas como la detección de objetos, la segmentación de imágenes, la localización exacta de los animales o la identificación individual de ejemplares concretos.

Conclusiones

Comprender correctamente el problema constituye el primer paso para desarrollar una solución de Inteligencia Artificial eficaz.

En este proyecto, el objetivo va mucho más allá de entrenar un modelo con una buena puntuación en una competición. Se pretende construir un flujo de trabajo completo, reproducible y bien documentado que sirva como ejemplo práctico de aplicación de técnicas modernas de Visión por Computador a un problema real de conservación de la biodiversidad.

En el siguiente artículo se abordará la fase de Analytic Approach, donde se justificará la elección de las técnicas de Machine Learning y Deep Learning más adecuadas para resolver este problema.