Regresar al inicio

Métodos computacionales

Del acervo al grafo

Tratamos los textos históricos como datos relacionales. Cada acervo recorre un pipeline reproducible que combina modelos de lenguaje, validación humana experta y análisis de redes, con cómputo self-hosted en infraestructura propia.

Corpus en proceso

Obras históricas
4
Páginas procesadas
1,575
Oraciones segmentadas
12,679
Entidades extraídas
31,352

Pipeline

  1. Digitalización

    Captura de alta resolución con cartas de color y escala. Modelos de visión evalúan hoja por hoja el estado físico del documento y generan reportes de restauración.

    • Captura de alta resolución
    • Cartas de color
    • LLMs de visión
  2. Limpieza asistida

    Modelos de lenguaje corrigen los errores de OCR y normalizan la transcripción, preservando la grafía histórica cuando es significativa.

    • Llama 2 7B
    • Normalización de formatos
  3. Reconocimiento de entidades

    Extracción automática de personas, lugares, instituciones y eventos, con alineación temporal y embeddings semánticos sobre el corpus.

    • Flair NER
    • Embeddings semánticos
    • Alineación temporal
  4. Validación humana

    Cada anotación pasa por revisión experta en herramientas propias y en Argilla. Ninguna entidad llega al grafo sin control humano y de vocabulario.

    • Argilla
    • Corrector NER propio
    • Controles de vocabulario
  5. Modelado de redes

    Construcción de grafos de concurrencia, detección de comunidades y comparación con realizaciones sintéticas para inferir dinámicas sociales a partir de observaciones parciales.

    • Grafos de concurrencia
    • Leiden / Louvain
    • Barabási–Albert

Stack

Modelos

  • Llama 2 7B
  • Flair
  • Hugging Face
  • LLMs de visión self-hosted
  • LightRAG

Anotación y validación

  • Argilla
  • Corrector NER (Next.js)
  • Revisión humana en el ciclo
  • Metadatos Dublin Core

Infraestructura

  • Servidor NVIDIA Blackwell
  • Memoria unificada
  • Almacenamiento NAS
  • Pipelines reproducibles