Acessibilidade do Site:
Artigo Científico & Benchmark Relatório Técnico UFG-INF / Submetido

Dr.Docbench: Um Benchmark e Framework para Avaliação de Compreensão e Acessibilização Estrutural de Documentos Científicos por Agentes de IA

Resumo: A digitalização e a conversão de documentos acadêmicos e científicos frequentemente geram arquivos PDF visuais sem marcação semântica, impossibilitando a leitura acessível por tecnologias assistivas (leitores de tela e linhas Braille). Este trabalho introduz o Dr.DocBench, um benchmark rigoroso e framework agentico projetado para avaliar e mitigar perdas estruturais na extração de documentos científicos complexos. Utilizando modelos de visão-linguagem (VLMs) e orquestração multimodal apoiada na infraestrutura de supercomputação do LaMCAD/UFG, a abordagem proposta atinge taxas superiores de recuperação hierárquica, reconstrução de tabelas e audiodescrição técnica de gráficos e equações matemáticas, viabilizando a conformidade com as normas PDF/UA (ISO 14289) e WCAG 2.2 AAA.

Benchmark Aberto

Métricas padronizadas de integridade semântica, fidelidade de tabelas e ordem de leitura linear.

Supercomputação LaMCAD

Processamento de alta performance para inferência de modelos multimodais de visão computacional.

Anotação Matemática

Conversão de fórmulas para MathML e notações navegáveis termo a termo por sintetizadores de voz.

Como Citar este Trabalho (BibTeX):
@techreport{inuzuka2026drdocbench,
  title       = {{Dr.Docbench: Um Benchmark e Framework para Avalia{\c{c}}{\~a}o de Compreens{\~a}o e Acessibiliza{\c{c}}{\~a}o Estrutural de Documentos Cient{\'i}ficos por Agentes de IA}},
  author      = {Inuzuka, Marcelo Akira and Cordeiro, Jhonata Fernandes},
  institution = {Universidade Federal de Goi{\'a}s, Instituto de Inform{\'a}tica (INF/UFG)},
  number      = {UFG-INF-2026-01},
  year        = {2026},
  address     = {Goi{\^a}nia, GO, Brasil},
  url         = {https://acessilia.org/pesquisa.html}
}
Avaliação Experimental

Resultados no Benchmark Dr.DocBench

Comparação da acurácia de extração estrutural do Acessília frente a ferramentas baseline tradicionais de OCR e processamento de documentos.

Resultados comparativos de acurácia estrutural no benchmark Dr.DocBench
Pipeline / Abordagem Hierarquia de Títulos (H1-H6) Tabelas Complexas (TEDS) Fórmulas (MathML) Audiodescrição de Figuras Conformidade PDF/UA
OCR Convencional (Tesseract) 41.2% 32.0% 12.4% 0.0% (Inexistente) Não conforme
Extratores de Texto PDF (pypdf/pdfplumber) 58.7% 48.5% 28.1% 0.0% Não conforme
Docling Baseline (Sem Agentes LLM) 82.4% 74.2% 68.9% 35.0% (Heurística) Parcial
Pipeline Acessília (Docling + Agentes IA) 95.8% 91.4% 89.6% 93.2% (Audiodescrição) 100% Conforme
Explorar Dataset no GitHub (A11yDevs/acessilia-dataset) (abre em nova janela)

Declaração de Conformidade de Acessibilidade

O sítio oficial do Acessília foi projetado e auditado para alcançar nível AAA de conformidade segundo as Diretrizes de Acessibilidade para Conteúdo Web (WCAG 2.2) do W3C e as recomendações do e-MAG (Modelo de Acessibilidade em Governo Eletrônico).

WCAG 2.2 AAA e-MAG Governo Federal PDF/UA (ISO 14289) MathPlayer & MathML HTML5 Semântico