RT info:eu-repo/semantics/masterThesis T1 Comparative evaluation of vision language models for table extraction in scanned spanish public tenders A1 Mbarek, Amine A2 Universidad de Valladolid. Escuela de Ingeniería Informática de Valladolid K1 Extracción de tablas K1 Modelos de visión y lenguaje K1 Documentos escaneados K1 Licitaciones públicas españolas AB Contexto y motivación: La contratación pública española representa aproximadamente el 11.5%del PIB y genera vastos repositorios de documentos escaneados que requieren procesamiento automatizado. La extracción de información estructurada de documentos escaneados presenta desafíos únicos:degradación de calidad de imagen, errores de OCR (hasta 20–40% en algunos corpus históricos),y estructuras tabulares complejas que resisten métodos de extracción convencionales. Objetivos:Esta tesis evalúa de forma comparativa modelos de visión y lenguaje (VLMs) para la extracción automatizada de tablas desde documentos escaneados de licitaciones públicas españolas. Los objetivosprincipales incluyen: (1) desarrollar un dataset sintético anotado de documentos escaneados de licitaciones públicas españolas con estructuras tabulares diversas y variaciones de calidad representativasdel mundo real, (2) evaluar sistemáticamente múltiples arquitecturas VLM (LLaVA-OneVision-1.5-8B,Qwen2.5-VL-7B-Instruct, e InternVL3_5-8B), y (3) establecer líneas base de rendimiento e identificarenfoques óptimos para despliegue en sistemas de procesamiento de documentos del sector público.Metodología: Se creó un dataset sintético licitaciones_dataset_test de 4,500 documentos y 5,845tablas que emula documentos escaneados reales mediante un pipeline de generación de 9 fases: planificación de planos, renderizado PDF, rasterización, distorsión geométrica (homografía), simulación deimpresión-escaneado, degradación adicional (Augraphy), validación de legibilidad, transformación deanotaciones, y rechazo de duplicados. El dataset incluye variaciones controladas en dificultad de ruido(fácil/medio/difícil), complejidad estructural (profundidad de encabezados, celdas fusionadas, tasa devalores faltantes), y factores de diversidad a nivel de documento y tabla. La evaluación se realizó utilizando métricas de similitud estructural (S-TEDS, GriTSproxy), métricas de contenido (TEDS, ANLS),y métricas de detección a nivel de página (precisión, recall, F1, exactitud, especificidad). Resultadosprincipales: Qwen2.5-VL-7B-Instruct logró el mejor rendimiento en estructura (S-TEDS=0.9740,GriTSproxy=1.789), con precisión perfecta pero 22 falsos negativos. LLaVA-OneVision-1.5-8B obtuvola mejor fidelidad de texto (ANLS=0.8366, TEDS=0.9603) pero mostró debilidades en reconstrucción estructural en tablas complejas (9 de 10 peores casos con S-TEDS < 0.5) y produjo 725 falsospositivos. InternVL3_5-8B mostró rendimiento consistentemente inferior en todas las métricas. Elanálisis de sensibilidad al peso de dificultad combinada (α) reveló que las diferencias entre modelosson estadísticamente significativas pero con tamaños de efecto pequeños para TEDS/S-TEDS (Cohen’s d < 0.2) y medianos para GriTSproxy (d ∈ [0.3, 0.7]). El análisis cualitativo identificó patronesde error específicos: colapso de encabezados multi-fila, errores de estructura de columnas, y errores detranscripción de texto (formato numérico, caracteres especiales). Conclusiones: Los VLMs ofrecensoluciones prometedoras para la extracción de tablas desde documentos escaneados de licitacionespúblicas españolas, pero ningún modelo resuelve completamente el problema. Qwen es óptimo paraaplicaciones que requieren alta precisión estructural, mientras que LLaVA es preferible cuando la fidelidad de texto es crítica. Las fallas se concentran en condiciones de ruido alto y estructuras complejas, sugiriendo que técnicas de preprocesamiento de imagen y post-procesamiento basado en reglas podríanmejorar significativamente la calidad de extracción. Este trabajo contribuye al avance de tecnologíasde IA multimodal y a la mejora de capacidades de procesamiento de documentos del sector público,allanando el camino hacia un sistema de contratación pública española más abierto y automatizado. YR 2026 FD 2026 LK https://uvadoc.uva.es/handle/10324/84506 UL https://uvadoc.uva.es/handle/10324/84506 LA eng NO Departamento de Informática (Arquitectura y Tecnología de Computadores, Ciencias de la Computación e Inteligencia Artificial, Lenguajes y Sistemas Informáticos) DS UVaDOC RD 11-jul-2026