<?xml version="1.0" encoding="UTF-8"?><?xml-stylesheet type="text/xsl" href="static/style.xsl"?><OAI-PMH xmlns="http://www.openarchives.org/OAI/2.0/" xmlns:xsi="http://www.w3.org/2001/XMLSchema-instance" xsi:schemaLocation="http://www.openarchives.org/OAI/2.0/ http://www.openarchives.org/OAI/2.0/OAI-PMH.xsd"><responseDate>2026-07-11T02:15:57Z</responseDate><request verb="GetRecord" identifier="oai:cerro64.cpd.uva.es:10324/84506" metadataPrefix="uketd_dc">https://cerro64.cpd.uva.es/oai/request</request><GetRecord><record><header><identifier>oai:uvadoc.uva.es:10324/84506</identifier><datestamp>2026-06-18T11:00:56Z</datestamp><setSpec>com_10324_38</setSpec><setSpec>col_10324_787</setSpec></header><metadata><uketd_dc:uketddc xmlns:uketd_dc="http://naca.central.cranfield.ac.uk/ethos-oai/2.0/" xmlns:doc="http://www.lyncode.com/xoai" xmlns:xsi="http://www.w3.org/2001/XMLSchema-instance" xmlns:uketdterms="http://naca.central.cranfield.ac.uk/ethos-oai/terms/" xmlns:dcterms="http://purl.org/dc/terms/" xmlns:dc="http://purl.org/dc/elements/1.1/" xsi:schemaLocation="http://naca.central.cranfield.ac.uk/ethos-oai/2.0/ http://naca.central.cranfield.ac.uk/ethos-oai/2.0/uketd_dc.xsd">
<dc:title>Comparative evaluation of vision language models for table extraction in scanned spanish public tenders</dc:title>
<dc:creator>Mbarek, Amine</dc:creator>
<uketdterms:advisor>Cardeñoso Payo, Valentín</uketdterms:advisor>
<dcterms:abstract>Contexto y motivación: La contratación pública española representa aproximadamente el 11.5%&#xd;
del PIB y genera vastos repositorios de documentos escaneados que requieren procesamiento automatizado. La extracción de información estructurada de documentos escaneados presenta desafíos únicos:&#xd;
degradación de calidad de imagen, errores de OCR (hasta 20–40% en algunos corpus históricos),&#xd;
y estructuras tabulares complejas que resisten métodos de extracción convencionales. Objetivos:&#xd;
Esta tesis evalúa de forma comparativa modelos de visión y lenguaje (VLMs) para la extracción automatizada de tablas desde documentos escaneados de licitaciones públicas españolas. Los objetivos&#xd;
principales incluyen: (1) desarrollar un dataset sintético anotado de documentos escaneados de licitaciones públicas españolas con estructuras tabulares diversas y variaciones de calidad representativas&#xd;
del mundo real, (2) evaluar sistemáticamente múltiples arquitecturas VLM (LLaVA-OneVision-1.5-8B,&#xd;
Qwen2.5-VL-7B-Instruct, e InternVL3_5-8B), y (3) establecer líneas base de rendimiento e identificar&#xd;
enfoques óptimos para despliegue en sistemas de procesamiento de documentos del sector público.&#xd;
Metodología: Se creó un dataset sintético licitaciones_dataset_test de 4,500 documentos y 5,845&#xd;
tablas que emula documentos escaneados reales mediante un pipeline de generación de 9 fases: planificación de planos, renderizado PDF, rasterización, distorsión geométrica (homografía), simulación de&#xd;
impresión-escaneado, degradación adicional (Augraphy), validación de legibilidad, transformación de&#xd;
anotaciones, y rechazo de duplicados. El dataset incluye variaciones controladas en dificultad de ruido&#xd;
(fácil/medio/difícil), complejidad estructural (profundidad de encabezados, celdas fusionadas, tasa de&#xd;
valores faltantes), y factores de diversidad a nivel de documento y tabla. La evaluación se realizó utilizando métricas de similitud estructural (S-TEDS, GriTSproxy), métricas de contenido (TEDS, ANLS),&#xd;
y métricas de detección a nivel de página (precisión, recall, F1, exactitud, especificidad). Resultados&#xd;
principales: Qwen2.5-VL-7B-Instruct logró el mejor rendimiento en estructura (S-TEDS=0.9740,&#xd;
GriTSproxy=1.789), con precisión perfecta pero 22 falsos negativos. LLaVA-OneVision-1.5-8B obtuvo&#xd;
la mejor fidelidad de texto (ANLS=0.8366, TEDS=0.9603) pero mostró debilidades en reconstrucción estructural en tablas complejas (9 de 10 peores casos con S-TEDS &lt; 0.5) y produjo 725 falsos&#xd;
positivos. InternVL3_5-8B mostró rendimiento consistentemente inferior en todas las métricas. El&#xd;
análisis de sensibilidad al peso de dificultad combinada (α) reveló que las diferencias entre modelos&#xd;
son estadísticamente significativas pero con tamaños de efecto pequeños para TEDS/S-TEDS (Cohen’s d &lt; 0.2) y medianos para GriTSproxy (d ∈ [0.3, 0.7]). El análisis cualitativo identificó patrones&#xd;
de error específicos: colapso de encabezados multi-fila, errores de estructura de columnas, y errores de&#xd;
transcripción de texto (formato numérico, caracteres especiales). Conclusiones: Los VLMs ofrecen&#xd;
soluciones prometedoras para la extracción de tablas desde documentos escaneados de licitaciones&#xd;
públicas españolas, pero ningún modelo resuelve completamente el problema. Qwen es óptimo para&#xd;
aplicaciones que requieren alta precisión estructural, mientras que LLaVA es preferible cuando la fidelidad de texto es crítica. Las fallas se concentran en condiciones de ruido alto y estructuras complejas, sugiriendo que técnicas de preprocesamiento de imagen y post-procesamiento basado en reglas podrían&#xd;
mejorar significativamente la calidad de extracción. Este trabajo contribuye al avance de tecnologías&#xd;
de IA multimodal y a la mejora de capacidades de procesamiento de documentos del sector público,&#xd;
allanando el camino hacia un sistema de contratación pública española más abierto y automatizado.</dcterms:abstract>
<dcterms:abstract>Context and motivation: Spanish public procurement represents approximately 11.5% of GDP&#xd;
and generates vast repositories of scanned documents requiring automated processing. Extracting&#xd;
structured information from scanned documents presents unique challenges: image quality degradation, OCR errors (reaching 20–40% in some historical corpora), and complex table structures that&#xd;
resist conventional extraction methods. Objectives: This thesis conducts a comparative evaluation&#xd;
of Vision Language Models (VLMs) for automated table extraction from scanned Spanish public procurement documents. The main objectives include: (1) developing an annotated synthetic dataset&#xd;
of scanned Spanish public procurement documents with diverse tabular structures and quality variations representative of real-world outputs, (2) systematically evaluating multiple VLM architectures&#xd;
(LLaVA-OneVision-1.5-8B, Qwen2.5-VL-7B-Instruct, and InternVL3_5-8B), and (3) establishing performance baselines and identifying optimal approaches for deployment in public sector document&#xd;
processing systems. Methodology: A synthetic dataset licitaciones_dataset_test of 4,500 documents and 5,845 tables was created to emulate real scanned documents through a 9-phase generation&#xd;
pipeline: blueprint planning, PDF rendering, rasterization, geometric distortion (homography), printscan simulation, additional degradation (Augraphy), legibility validation, annotation transformation,&#xd;
and near-duplicate rejection. The dataset includes controlled variations in noise difficulty (easy/medium/hard), structural complexity (header depth, merged cells, missingness rate), and document- and&#xd;
table-level diversity factors. Evaluation was conducted using structural similarity metrics (S-TEDS,&#xd;
GriTSproxy), content metrics (TEDS, ANLS), and page-level detection metrics (precision, recall, F1,&#xd;
accuracy, specificity). Main results: Qwen2.5-VL-7B-Instruct achieved the best structure performance (S-TEDS=0.9740, GriTSproxy=1.789), with perfect precision but 22 false negatives. LLaVAOneVision-1.5-8B achieved the best text fidelity (ANLS=0.8366, TEDS=0.9603) but showed weaknesses in structural reconstruction in complex tables (9 out of 10 worst cases with S-TEDS &lt; 0.5)&#xd;
and produced 725 false positives. InternVL3_5-8B showed consistently inferior performance across all&#xd;
metrics. Sensitivity analysis of the combined difficulty weight (α) revealed that differences between&#xd;
models are statistically significant but with small effect sizes for TEDS/S-TEDS (Cohen’s d &lt; 0.2)&#xd;
and medium for GriTSproxy (d ∈ [0.3, 0.7]). Qualitative analysis identified specific error patterns:&#xd;
multi-row header collapse, column structure errors, and text transcription errors (number formatting,&#xd;
special characters). Conclusions: VLMs offer promising solutions for table extraction from scanned&#xd;
Spanish public procurement documents, but no single model fully solves the problem. Qwen is optimal&#xd;
for applications requiring high structural precision, while LLaVA is preferable when text fidelity is&#xd;
critical. Failures concentrate in high-noise conditions and complex structures, suggesting that image&#xd;
preprocessing techniques and rule-based post-processing could significantly improve extraction quality. This work contributes to the advancement of multimodal AI technologies and the improvement&#xd;
of public sector document processing capabilities, paving the way toward a more open and automated&#xd;
Spanish public procurement system.</dcterms:abstract>
<dcterms:issued>2026</dcterms:issued>
<dc:type>info:eu-repo/semantics/masterThesis</dc:type>
<dc:language xsi:type="dcterms:ISO639-2">eng</dc:language>
<uketdterms:sponsor>Departamento de Informática (Arquitectura y Tecnología de Computadores, Ciencias de la Computación e Inteligencia Artificial, Lenguajes y Sistemas Informáticos)</uketdterms:sponsor>
<dcterms:isReferencedBy>https://uvadoc.uva.es/handle/10324/84506</dcterms:isReferencedBy>
<dcterms:license>https://uvadoc.uva.es/bitstream/10324/84506/3/license.txt</dcterms:license>
<uketdterms:checksum xsi:type="uketdterms:MD5">289d98c1665ee0d20312360f0e8643c8</uketdterms:checksum>
<dc:identifier xsi:type="dcterms:URI">https://uvadoc.uva.es/bitstream/10324/84506/1/TFM-G2410.pdf</dc:identifier>
<uketdterms:checksum xsi:type="uketdterms:MD5">9ddb7354c91fc8937a709e9d37ef106f</uketdterms:checksum>
<dc:rights>Attribution-NonCommercial-NoDerivatives 4.0 Internacional</dc:rights>
</uketd_dc:uketddc></metadata></record></GetRecord></OAI-PMH>