# Computer Vision aplicada a la biomedicina

https://www.mecexis.com/ca/projectes/pigment/

Hores de vídeo analitzades en minuts: el comportament de l'animal mesurat i comparat al llarg de la seva recuperació, sense que ningú ho hagi de veure.

L' **Institut de Recerca Germans Trias i Pujol (IGTP)** avalua la recuperació dels animals d'estudi a partir del vídeo. Fins ara, cada hora de gravació costava una hora datenció duna persona, i el resultat depenia de qui mirés. Amb PIG-MENT, la plataforma desenvolupada per Mecexis, aquesta hora de vídeo es converteix en dos minuts de càlcul i en un conjunt de mètriques de comportament idèntiques a cada execució, organitzades per animal, per moment de l'estudi i per grup de tractament, llistes per a l'estadística. L?equip investigador deixa de mirar vídeos i passa a analitzar dades.

## Investigació biomèdica que necessitava mesurar, no descriure

Un institut de referència i una pregunta sense resposta numèrica

L' **IGTP** és un centre de recerca públic situat a Badalona, ​​associat a l'Hospital Germans Trias i Pujol i part del campus biomèdic de Can Ruti. És un centre CERCA, acreditat com a centre d'excel·lència per l'Institut de Salut Carlos III. El seu equip treballa amb un model animal porcí per estudiar la recuperació després d'una intervenció quirúrgica: com cada animal evoluciona els dies posteriors i si un tractament modifica aquesta evolució respecte al grup de control.

Les dades ja existien. Cambres fixes sobre cada corral graven sessions de matí, tarda i nit, abans i després de la intervenció. El que faltava era una manera d'extreure d'aquelles hores de vídeo valors objectius per fer estadística, sense que ningú s'hagués d'asseure a mirar-les.

## Hores de dedicació humana per cada hora d'enregistrament

Un coll d'ampolla que creix cada dia d'estudi

La valoració postquirúrgica es feia per observació: una persona veia els enregistraments i puntuava els comportaments. El cost és lineal i no baixa: cada hora de vídeo costa una hora datenció, i un estudi grava cada animal diverses vegades al dia durant dies, abans i després de la intervenció. El volum de vídeo creix més de pressa del que cap equip no pot veure, i el que no es veu no es mesura.

A aquest cost se suma un problema de qualitat. Dos observadors no obtenen el mateix resultat, i el que surt de l'observació són descripcions i escales, no mesures: res per detectar una tendència subtil o contrastar dos grups amb rigor. La pregunta que l'IGTP va portar a Mecexis era doble: es pot automatitzar aquesta tasca, i es pot fer de manera que el resultat sigui millor que el manual, no només més barat?

La resposta no era òbvia. Cambres de gran angular que deformen la imatge, corrals que es veuen parcialment, cordes i altres elements que creuen davant de l'animal, cap data gravada a l'arxiu de vídeo. I un problema concret que descarta l'enfocament habitual: els mètodes que detecten l'animal a través del moviment per diferència amb el fons l'absorbeixen quan es queda quiet, just en el moment en què cal mesurar quant de temps descansa.

## Computer Vision per automatitzar el processament dels enregistraments, sense perdre el criteri de l'equip

PIG-MENT es compon de dues parts que treballen juntes: una cadena d'algoritmes de visió per computador que extreu mètriques a partir de vídeo sense intervenció humana, i una aplicació web on l'equip investigador gestiona, revisa i compara tot el procés. La màquina fa la feina repetitiva que abans ocupava hores; les persones conserven les decisions que requereixen criteri, com ara validar la geometria de cada cambra o interpretar-ne els resultats.

### Tres mètriques d´un sol vídeo

Donat un arxiu de vídeo com a única entrada, el sistema torna tres mesures sense intervenció humana. El **circling** explica les voltes completes de l'animal per sentit i detecta si afavoreix sistemàticament una banda, l'indicador neurològic més directe després d'una intervenció. El **mapa docupació** mostra on passa el temps dins del corral, en centímetres reals, i quant a cada zona dinterès. El **temps de repòs** mesura quina fracció del temps roman immòbil i com es reparteix. Cada vídeo porta a més els indicadors de qualitat i les figures de control, perquè una xifra mai vagi sola.

### Optimitzat per a CPU convencional, sense GPU

L'animal es localitza pel color càlid, amb segmentació, contorns i moments d'imatge. La decisió té conseqüències pràctiques molt positives: no es va haver d'etiquetar ni un vídeo, no cal GPU, el cost d'infraestructura és baix i previsible, i cada resultat es pot explicar a través de l'algorisme. A més, resol el problema del repòs per construcció: l'animal és rosat estigui quiet o en moviment.

### Centímetres reals, comparables entre corrals i càmeres

Cada càmera es calibra una vegada amb un patró de calibratge per corregir la distorsió de la seva lent, i cada enregistrament detecta automàticament els quatre cantons del terra del corral. Amb les dimensions reals del corral, tota mida s'expressa sobre el mateix pla en centímetres. Dos corrals diferents o dues posicions de càmera produeixen números comparables, i l'alçada de la càmera ni tan sols es configura: es resol sola a partir de la geometria validada.

### El vídeo es processa una vegada; tota la resta triga segons

La lectura del vídeo, que és la part més costosa, s'executa una sola vegada i enregistra la posició, l'àrea i l'orientació de l'animal a cada fotograma. Recalcular una mètrica, corregir l'escala o recomputar les zones treballa sobre aquestes dades i triga segons. Quan el disc s'omple, el metratge més antic es pot esborrar sense perdre res: els resultats continuen sent reproduïbles.

### Una plataforma que coneix l'estudi

L'aplicació web guia el flux complet: pujar el clip (directament a l'emmagatzematge, sense passar pel servidor, per a fitxers de diversos gigabytes), descriure'l, validar la posició de la càmera sobre una imatge de referència, processar-lo en segon pla i llegir-ne els resultats. La data d'enregistrament es llegeix del rellotge imprès a la pròpia imatge, perquè la càmera no l'escriu al fitxer. Fase, dies des de la intervenció i franja horària es deriven sempre de dues dates, de manera que corregir una corregeix totes les pàgines.

### La capa d'interpretació: del vídeo aïllat a la comparació

El valor científic no està en un vídeo, és al contrast. L' **evolució de l'animal** ajunta els seus enregistraments en sessions sobre un eix de temps real des de la intervenció i mostra el moviment de cada mètrica respecte del propi preoperatori. El **constructor de comparacions** enfronta conjunts d'animals, amb un conjunt de referència, i calcula la diferència de diferències que respon a la pregunta de l'estudi: l'evolució ha modificat el tractament? Els filtres d'evidència retiren de la mitjana els clips massa curts i l'alerten a la pantalla. L'eina presenta; la persona investigadora conclou.

### Dades a punt per a l'estadística, amb el llibre de codis

Cada exportació és un únic arxiu amb catorze taules unides per identificadors, a Excel, CSV i Parquet, més les figures, les trajectòries i un README generat des del propi codi que defineix cada columna, cada mètrica i les regles amb què s'ha calculat. És possible amagar el grup de tractament dels resultats als investigadors, perquè puguin treballar sense estar condicionats.

### Arquitectura preparada per a producció

Django i PostgreSQL, processos en segon pla sobre dues cues perquè la interacció mai no esperi darrere d'un lot de vídeos, emmagatzematge d'objectes compatible amb S3, infraestructura dockeritzada, desplegament automàtic, seguiment d'errors i un conjunt de proves sobre trajectòries sintètiques que fixa el comportament de l'algorisme. La mateixa disciplina que Mecexis aplica a qualsevol projecte, aplicada a un instrument de mesura científic.

## Primer demostrar que era possible, després construir el producte

Un prototip per decidir, una plataforma per treballar

El projecte va començar amb una pregunta de viabilitat, no amb una plataforma. La **primera fase** es va plantejar com a prototipat: analitzar el problema, revisar l'estat de l'art i les eines existents, i construir la cadena de visió per ordinador sobre els enregistraments reals de l'IGTP. L?objectiu era decidir amb dades si el projecte era viable. Els resultats es van contrastar amb el que una persona veu a la pantalla, com el recompte de girs d'un animal o la diferència entre un de tranquil i un d'actiu, i amb la velocitat mesurada sobre CPU convencional. Només després de comprovar que les bases sobre les quals es construeix el projecte són sòlides es va continuar endavant.

La **segona fase** va convertir el prototip en producte: la plataforma web amb el model de dades de l'estudi, el processament en segon pla i l'exportació, posada en mans de l'equip investigador com a beta per a ús real. La **tercera** va partir del que havia demanat un mes d'ús, va afegir la capa de comparació i va portar el sistema a producció. Cada fase va tenir un abast tancat i es va lliurar i validar abans d'obrir la següent, de manera que el client va decidir a cada pas amb el resultat anterior a la vista.

Treballar sobre el material real des del primer dia va marcar el camí. Cordes que tallaven la silueta de l'animal, individus més pàl·lids que altres, reflexos, corrals veïns abocant a l'enquadrament, vídeos sense data gravada: cada obstacle va aparèixer a les gravacions de l'estudi durant el prototipat, quan corregir-lo era barat, i es va resoldre a la peça de la cadena que li corresponia sense tocar. I on cal criteri, ho posa l'equip: la geometria de cada càmera la valida una persona sobre la imatge, amb la proposta automàtica del sistema com a punt de partida. L'eina proposa i confirma la persona.

## Reducció dràstica del temps d'observació manual

El temps de les persones, dedicat a allò que només les persones poden fer.

- 1h → 2min: Temps de revisió per vídeo
- 0h: Temps de visionat per obtenir les mètriques
- 100%: Fotogrames amb l'animal localitzat

## Una base pensada per extreure més mètriques

Noves mètriques sense reescriure les existents

La cadena de processament es va dissenyar per créixer: cada mètrica és un algorisme independent sobre una base comuna de senyals, així que afegir-ne una de nova és afegir una peça al final sense revisar les anteriors.

A l'horitzó hi ha l'automatització de la captació, amb les càmeres lliurant els clips directament i la plataforma tallant-los per sessió, i l'extensió a altres instal·lacions: els calibratges de lent es carreguen per nom, de manera que un segon centre amb les seves pròpies càmeres funciona sense bifurcar el codi.
