Oxcart
Oxcart es un sistema GraphRAG especializado en la filatelia costarricense: 162 años de historia del sello postal vueltos consultables. Quien investiga pregunta por emisiones, variedades, planchas, sobrecargos, falsificaciones e historia postal, y obtiene respuestas fundamentadas y citadas a partir de un corpus de 1.424 documentos fusionado con un grafo de conocimiento del catálogo.
Por dentro del grafo de conocimiento.
El explorador del grafo de conocimiento en Neo4j detrás de las respuestas fundamentadas y citadas de Oxcart: emisiones, documentos, fragmentos y el rastro de evidencia entre ellos.
La filatelia costarricense tiene un problema de documentación. 162 años de historia del sello, desde la primera emisión en 1863, están dispersos en literatura difícil de consultar: catálogos, décadas de boletines de sociedades, monografías, estudios de falsificaciones, boletines postales y resultados de subastas. Casi todo son PDFs escaneados, alrededor del 70 % en español, que nunca se referencian entre sí y siguen varios sistemas de numeración de catálogo incompatibles. Oxcart vuelve consultable ese corpus.
Las preguntas filatélicas son difíciles porque mezclan nomenclatura exacta (números de catálogo, denominaciones, medidas de dentado) con relato: historia, procedencia, análisis de falsificaciones. Un RAG vectorial puro no alcanza. Por eso Oxcart procesa el corpus con Dolphin, usando LandingAI ADE como respaldo selectivo de alta fidelidad, lo incrusta en Weaviate y lo fusiona con un grafo de conocimiento del catálogo en Neo4j. Las consultas exactas se resuelven contra entidades precisas, luego se expanden hacia la evidencia textual, y cada respuesta lleva citas de primera clase hasta el documento, la página y el fragmento.
Es el mismo patrón GraphRAG que validamos de principio a fin en Canopy Intelligence y maduramos durante años de trabajo de recuperación en Nairu, desde Elasticsearch a embeddings a RAG a GraphRAG, ahora apuntado a un nuevo dominio: el patrimonio cultural. Lo presentamos con honestidad: un prototipo de investigación avanzado, con un demo en Gradio que levantamos a pedido, no un servicio en producción. De código abierto, con licencia MIT.
De PDFs escaneados a respuestas citadas.
- 01
Procesar
Dolphin procesa 1.424 PDFs (22.940 páginas de literatura filatélica escaneada) con LandingAI ADE como respaldo selectivo de alta fidelidad.
- 02
Enriquecer
Los fragmentos se tipifican (texto, encabezados, decretos, avisos de emisión, resultados de subasta, pies de figura) y se vinculan a emisiones, catálogos y fechas.
- 03
Doble índice
193.180 fragmentos incrustados en Weaviate; el catálogo Mena 2018 estructurado en un grafo de conocimiento en Neo4j.
- 04
Fundamentar
Las consultas por número de catálogo y nombre de emisión se resuelven contra entidades del grafo, luego se expanden hacia la evidencia en la literatura.
- 05
Responder
Respuestas fundamentadas y citadas (documento, página y fragmento) en una interfaz Gradio con un visor de grafo en vivo.
Oxcart es un prototipo de investigación avanzado, no un servicio en producción: un corpus real, completamente indexado, y un demo en Gradio que levantamos a pedido. El código tiene licencia MIT y es abierto, así que cualquiera puede leerlo y verificar el trabajo.