# Computer Vision aplicada a la biomedicina

https://www.mecexis.com/es/proyectos/pigment/

Horas de vídeo analizadas en minutos: el comportamiento del animal medido y comparado a lo largo de su recuperación, sin que nadie tenga que verlo.

El **Institut de Recerca Germans Trias i Pujol (IGTP)** evalúa la recuperación de los animales de estudio a partir de vídeo. Hasta ahora, cada hora de grabación costaba una hora de atención de una persona, y el resultado dependía de quién mirara. Con PIG-MENT, la plataforma desarrollada por Mecexis, esa hora de vídeo se convierte en dos minutos de cálculo y en un conjunto de métricas de comportamiento idénticas en cada ejecución, organizadas por animal, por momento del estudio y por grupo de tratamiento, listas para la estadística. El equipo investigador deja de mirar vídeos y pasa a analizar datos.

## Investigación biomédica que necesitaba medir, no describir

Un instituto de referencia y una pregunta sin respuesta numérica

El **IGTP** es un centro de investigación público situado en Badalona, asociado al Hospital Germans Trias i Pujol y parte del campus biomédico de Can Ruti. Es un centro CERCA, acreditado como centro de excelencia por el Instituto de Salud Carlos III. Su equipo trabaja con un modelo animal porcino para estudiar la recuperación tras una intervención quirúrgica: cómo evoluciona cada animal en los días posteriores y si un tratamiento modifica esa evolución respecto al grupo de control.

Los datos ya existían. Cámaras fijas sobre cada corral graban sesiones de mañana, tarde y noche, antes y después de la intervención. Lo que faltaba era una forma de extraer de esas horas de vídeo valores objetivos con los que hacer estadística, sin que nadie tuviera que sentarse a mirarlas.

## Horas de dedicación humana por cada hora de grabación

Un cuello de botella que crece con cada día de estudio

La valoración postquirúrgica se hacía por observación: una persona veía las grabaciones y puntuaba los comportamientos. El coste es lineal y no baja: cada hora de vídeo cuesta una hora de atención, y un estudio graba a cada animal varias veces al día durante días, antes y después de la intervención. El volumen de vídeo crece más deprisa de lo que ningún equipo puede ver, y lo que no se ve no se mide.

A ese coste se suma un problema de calidad. Dos observadores no obtienen el mismo resultado, y lo que sale de la observación son descripciones y escalas, no medidas: nada con lo que detectar una tendencia sutil o contrastar dos grupos con rigor. La pregunta que el IGTP trajo a Mecexis era doble: ¿se puede automatizar esta tarea, y se puede hacer de forma que el resultado sea mejor que el manual, no solo más barato?

La respuesta no era obvia. Cámaras de gran angular que deforman la imagen, corrales que se ven parcialmente, cuerdas y otros elementos que cruzan por delante del animal, ninguna fecha grabada en el archivo de vídeo. Y un problema concreto que descarta el enfoque habitual: los métodos que detectan al animal a través del movimiento por diferencia con el fondo lo "absorben" cuando se queda quieto, justo en el momento en que hay que medir cuánto tiempo descansa.

## Computer Vision para automatizar el procesamiento de las grabaciones, sin perder el criterio del equipo

PIG-MENT se compone de dos partes que trabajan juntas: una cadena de algoritmos de visión por computador que extrae métricas a partir de vídeo sin intervención humana, y una aplicación web donde el equipo investigador gestiona, revisa y compara todo el proceso. La máquina hace el trabajo repetitivo que antes ocupaba horas; las personas conservan las decisiones que requieren criterio, como validar la geometría de cada cámara o interpretar los resultados.

### Tres métricas de un solo vídeo

Dado un archivo de vídeo como única entrada, el sistema devuelve tres medidas sin intervención humana. El **circling** cuenta las vueltas completas del animal por sentido y detecta si favorece sistemáticamente un lado, el indicador neurológico más directo tras una intervención. El **mapa de ocupación** muestra dónde pasa el tiempo dentro del corral, en centímetros reales, y cuánto en cada zona de interés. El **tiempo de reposo** mide qué fracción del tiempo permanece inmóvil y cómo se reparte. Cada vídeo trae además sus indicadores de calidad y sus figuras de control, para que una cifra nunca vaya sola.

### Optimizado para CPU convencional, sin GPU

El animal se localiza por su color cálido, con segmentación, contornos y momentos de imagen. La decisión tiene consecuencias prácticas muy positivas: no hubo que etiquetar ni un solo vídeo, no hace falta GPU, el coste de infraestructura es bajo y previsible, y cada resultado se puede explicar a través del algoritmo. Además, resuelve el problema del reposo por construcción: el animal es rosado esté quieto o en movimiento.

### Centímetros reales, comparables entre corrales y cámaras

Cada cámara se calibra una vez con un patrón de calibración para corregir la distorsión de su lente, y cada grabación detecta automáticamente las cuatro esquinas del suelo del corral. Con las dimensiones reales del corral, toda medida se expresa sobre el mismo plano en centímetros. Dos corrales distintos o dos posiciones de cámara producen números comparables, y la altura de la cámara ni siquiera se configura: se resuelve sola a partir de la geometría validada.

### El vídeo se procesa una vez; todo lo demás tarda segundos

La lectura del vídeo, que es la parte más costosa, se ejecuta una sola vez y registra la posición, el área y la orientación del animal en cada fotograma. Recalcular una métrica, corregir la escala o recomputar las zonas trabaja sobre estos datos y tarda segundos. Cuando el disco se llena, el metraje más antiguo puede borrarse sin perder nada: los resultados siguen siendo reproducibles.

### Una plataforma que conoce el estudio

La aplicación web guía el flujo completo: subir el clip (directamente al almacenamiento, sin pasar por el servidor, para archivos de varios gigabytes), describirlo, validar la posición de la cámara sobre una imagen de referencia, procesarlo en segundo plano y leer los resultados. La fecha de grabación se lee del reloj impreso en la propia imagen, porque la cámara no la escribe en el archivo. Fase, días desde la intervención y franja horaria se derivan siempre de dos fechas, de modo que corregir una corrige todas las páginas.

### La capa de interpretación: del vídeo aislado a la comparación

El valor científico no está en un vídeo, está en el contraste. La **evolución del animal** junta sus grabaciones en sesiones sobre un eje de tiempo real desde la intervención y muestra el movimiento de cada métrica respecto a su propio preoperatorio. El **constructor de comparaciones** enfrenta conjuntos de animales, con un conjunto de referencia, y calcula la diferencia de diferencias que responde a la pregunta del estudio: ¿ha modificado el tratamiento la evolución? Los filtros de evidencia retiran de la mediana los clips demasiado cortos y lo alertan en pantalla. La herramienta presenta; la persona investigadora concluye.

### Datos listos para la estadística, con su libro de códigos

Cada exportación es un único archivo con catorce tablas unidas por identificadores, en Excel, CSV y Parquet, más las figuras, las trayectorias y un README generado desde el propio código que define cada columna, cada métrica y las reglas con las que se ha calculado. Es posible ocultar el grupo de tratamiento de los resultados a los investigadores, para que puedan trabajar sin estar condicionados.

### Arquitectura preparada para producción

Django y PostgreSQL, procesos en segundo plano sobre dos colas para que la interacción nunca espere detrás de un lote de vídeos, almacenamiento de objetos compatible con S3, infraestructura dockerizada, despliegue automático, seguimiento de errores y un conjunto de pruebas sobre trayectorias sintéticas que fija el comportamiento del algoritmo. La misma disciplina que Mecexis aplica a cualquier proyecto, aplicada a un instrumento de medida científico.

## Primero demostrar que era posible, después construir el producto

Un prototipo para decidir, una plataforma para trabajar

El proyecto arrancó con una pregunta de viabilidad, no con una plataforma. La **primera fase** se planteó como prototipado: analizar el problema, revisar el estado del arte y las herramientas existentes, y construir la cadena de visión por computador sobre las grabaciones reales del IGTP. El objetivo era decidir con datos si el proyecto era viable. Los resultados se contrastaron con lo que una persona ve en pantalla, como el recuento de giros de un animal o la diferencia entre uno tranquilo y uno activo, y con la velocidad medida sobre CPU convencional. Solo después de comprobar que las bases sobre las que se construye el proyecto son sólidas se continuó adelante.

La **segunda fase** convirtió el prototipo en producto: la plataforma web con el modelo de datos del estudio, el procesamiento en segundo plano y la exportación, puesta en manos del equipo investigador como beta para uso real. La **tercera** partió de lo que un mes de uso había pedido, añadió la capa de comparación y llevó el sistema a producción. Cada fase tuvo un alcance cerrado y se entregó y validó antes de abrir la siguiente, de modo que el cliente decidió en cada paso con el resultado anterior a la vista.

Trabajar sobre el material real desde el primer día marcó el camino. Cuerdas que cortaban la silueta del animal, individuos más pálidos que otros, reflejos, corrales vecinos asomando en el encuadre, vídeos sin fecha grabada: cada obstáculo apareció en las grabaciones del estudio durante el prototipado, cuando corregirlo era barato, y se resolvió en la pieza de la cadena que le correspondía sin tocar las demás. Y donde hace falta criterio, lo pone el equipo: la geometría de cada cámara la valida una persona sobre la imagen, con la propuesta automática del sistema como punto de partida. La herramienta propone y la persona confirma.

## Reducción drástica del tiempo de observación manual

El tiempo de las personas, dedicado a lo que solo las personas pueden hacer.

- 1h → 2min: Tiempo de revisión por video
- 0h: Tiempo de visionado para obtener las métricas
- 100%: Fotogramas con el animal localizado

## Una base pensada para extraer más métricas

Nuevas métricas sin reescribir las existentes

La cadena de procesamiento se diseñó para crecer: cada métrica es un algoritmo independiente sobre una base común de señales, así que añadir una nueva es añadir una pieza al final sin revisar las anteriores.

En el horizonte están la automatización de la captación, con las cámaras entregando los clips directamente y la plataforma cortándolos por sesión, y la extensión a otras instalaciones: las calibraciones de lente se cargan por nombre, de modo que un segundo centro con sus propias cámaras funciona sin bifurcar el código.
