En el contexto de la recuperación aumentada por generación (RAG), la práctica tradicional consiste en dividir los documentos en fragmentos de tamaño fijo, convertir cada fragmento en un vector y buscar coincidencias de similitud para alimentar al modelo de lenguaje. Esta estrategia resulta económica y eficaz para consultas simples, pero presenta limitaciones estructurales cuando se trata de documentos extensos y jerárquicos, como informes anuales, manuales técnicos o normas regulatorias. Es importante destacar que al aplanar la estructura original del texto se pierden relaciones implícitas entre encabezados, secciones y tablas, lo que obliga al modelo a inferir conexiones que el autor ya había establecido de forma explícita.
Una consideración clave es reconocer que los documentos no son meras colecciones de palabras, sino árboles de información organizados mediante títulos, subsecciones, listas y elementos visuales. Mantener esa arquitectura permite que un agente de IA razone sobre la ubicación contextual de cada fragmento, tal como lo haría un lector humano al consultar el índice, saltar a la sección pertinente y seguir referencias cruzadas. Cuando el agente conserva el árbol estructural, cada paso de navegación aporta contexto adicional: el encabezado que encabeza un párrafo, la tabla que complementa una explicación o la nota al pie que aclara un término. La experiencia nos demuestra que este contexto implícito reduce significativamente la probabilidad de que el modelo genere respuestas “alucinadas” basadas en fragmentos aislados.
Docling actúa como el puente que transforma PDFs, que carecen de una representación estructurada accesible, en documentos con un árbol de secciones, encabezados y tablas preservados. Al procesar el PDF, Docling reconstruye la jerarquía original del autor, asignando a cada elemento su posición en el flujo de lectura y manteniendo la integridad de tablas y gráficos. Con este árbol disponible, el agente Docling puede ejecutar una estrategia de navegación iterativa: parte de un resumen breve de cada sección para estimar la relevancia, abre la sección más prometedora, la lee en detalle y, si la información es insuficiente, avanza a la siguiente rama del árbol. Este razonamiento estructurado permite responder preguntas que requieren combinar información dispersa en distintas partes del documento, algo que la búsqueda por similitud de fragmentos no logra de forma fiable.
No obstante, la adopción de RAG sin trozos implica desafíos operacionales. La generación del árbol estructurado exige una fase previa de extracción y normalización que puede ser costosa en términos de cómputo y tiempo, especialmente para volúmenes masivos de documentos heterogéneos. Además, la navegación basada en estructura genera un mayor número de interacciones con el modelo de lenguaje, lo que incrementa la latencia y el consumo de tokens. Por ello, la práctica recomendada consiste en combinar ambos enfoques: utilizar la búsqueda vectorial para identificar rápidamente el conjunto de documentos relevantes y, una vez localizado el documento objetivo, aplicar la navegación estructurada para extraer la respuesta con precisión.
En entornos donde la exactitud y la trazabilidad son críticas —por ejemplo, auditorías financieras, cumplimiento regulatorio o análisis jurídico— la precisión que aporta la preservación de la estructura supera con creces el coste adicional. La capacidad de seguir el mapa conceptual trazado por el autor permite al agente ofrecer respuestas fundamentadas, con referencias claras a la sección y al contexto original, facilitando la validación por parte de expertos humanos. En resumen, mantener el documento entero y razonar a través de su árbol estructural representa una evolución natural de RAG, alineada con la necesidad de extraer conocimiento de manera fiable y contextualizada en la era de la inteligencia artificial aplicada a la nube.
Fuente: YouTube



