|
Suominen (2019) |
Inglês; artigos e registros de repositórios universitários |
YSO - Yleinen Suomalainen Ontologia (Ontologia Geral Finlandesa) |
Demonstra o potencial do Annif em repositórios universitários, mostrando que parte significativa das sugestões foi adotada por bibliotecários. Introduz a arquitetura modular e a integração via serviço web, ressaltando ganhos práticos no fluxo de trabalho e a necessidade de um corpus mais representativo e de refinamento contínuo. |
|
Lehtonen e Piukkula (2020) |
Finlandês; registros de programas de rádio e TV da base Ritva |
YSO - Yleinen Suomalainen Ontologia (Ontologia Geral Finlandesa) |
Avaliaram a aplicação do Annif em indexação de programas audiovisuais em grande escala. Mostram que, treinado com um corpus substancial de descrições, o sistema atribuiu termos relevantes de forma consistente. Destacam o potencial do sistema para ampliar a acessibilidade e a recuperação temática de acervos audiovisuais, ressaltando a necessidade de ajustes contínuos de treinamento e de curadoria do vocabulário. |
|
Hahn (2021) |
Inglês; registros bibliográficos no formato MARC para entidades de trabalho em bibliotecas |
LCSH (Library of Congress Subject Headings) |
Investigou métodos semiautomáticos em BIBFRAME. Utilizou o Annif para sugerir descritores do LCSH, articulando-o a linked data. Destacou a viabilidade da abordagem librarian-in-the-loop. Privilegiou análises de integração e usabilidade, sem foco em métricas clássicas. |
|
Lappalainen et al. (2021) |
Multilíngue (finlandês, inglês, sueco); registros de bibliotecas, arquivos e museus |
YSO - Yleinen Suomalainen Ontologia (Ontologia Geral Finlandesa) e vocabulários específicos de domínio |
Apresentam os desafios e soluções no desenvolvimento do Annif em bibliotecas, arquivos e museus. Documentam aspectos técnicos da arquitetura, o uso de múltiplos algoritmos e ensembles. Enfatizam a importância da avaliação contínua por métricas (precisão, revocação, F1, NDCG) e da participação humana em processos semiautomáticos. |
|
Suominen, Inkinen e Lehtinen (2022) |
Multilíngue (finlandês, sueco, inglês); registros institucionais e catálogos |
YSO - Yleinen Suomalainen Ontologia (Ontologia Geral Finlandesa) e vocabulários nacionais integrados ao Finto AI |
Descrevem o desenvolvimento do Annif e do serviço Finto AI, destacando sua integração em fluxos automatizados (ex. DSpace). Relatam desafios técnicos e operacionais de escalabilidade e manutenção em ambientes multilíngues. |
|
Suominen e Koskenniemi (2022) |
Multilíngue (finlandês, sueco e inglês); corpus de teses (University of Jyväskylä), descrições de livros (Kirjavälitys Oy) e registros de descoberta (Finna.fi) |
YSO (incluindo o YSO Places) e YKL - Classificação das Bibliotecas Públicas da Finlândia |
Compararam nove métodos de normalização lexical (stemming e lematização) no Annif. Testaram backends MLLM, Omikuji Parabel e Bonsai. Concluíram que lematização avançados (ex. stanza) superam abordagens básicas em finlandês e sueco, enquanto em inglês métodos simples (Snowball) se mostraram eficazes. O estudo orientou a integração do Simplemma como módulo do Annif. |
|
Brito e Martins (2023a) |
Português; 438 títulos, resumos e palavras-chave de artigos (BRAPCI) e texto completo de teses e dissertações do Repositório da Universidade de Brasília (RiUnB) |
Termos do Tesauro Brasileiro de Ciência da Informação (TBCI) |
Propõem um framework genérico para a geração automática de assuntos em repositórios digitais. Destacam a importância de um vocabulário controlado e um corpus adequado e robusto para treinamento e recomendam que os metadados gerados automaticamente sejam revisados e validados por especialistas para garantir a qualidade e precisão. |
|
Brito e Martins (2023b) |
Português; 52 títulos, resumos e palavras-chave de artigos (BRAPCI) e texto completo de tese do Repositório Institucional da UnB (RiUnB) |
Termos do Tesauro Brasileiro de Ciência da Informação (TBCI) |
Estudo de caso que aplicou o Annif (backend MLLM) em dois níveis: (i) treinamento com 52 artigos da BRAPCI; (ii) teste preliminar com texto completo de tese do RiUnB para validar um framework de indexação. Os resultados mostraram boa similaridade entre termos sugeridos e palavras-chave do autor, mas sem comparações sistemáticas entre diferentes backends. |
|
Ahmed, Mukhopadhyay e Mukhopadhyay (2023) |
Inglês e hindi; registros bibliográficos MARC |
LCSH em Linked Open Data (LOD) |
Aplicaram o Annif em um ambiente experimental de bibliotecas, testando diferentes bakcends (TF-IDF, Omikuji-Parabel, Omikuji-Bonsai e NN-Ensemble). O estudo evidenciou a viabilidade da indexação semiautomatizada baseada em IA/ML, mas ressaltou a dependência da qualidade do corpus de treinamento e a necessidade de supervisão humana. |
|
Mitra e Mukhopadhyay (2023) |
Inglês; corpus de treinamento composto por mais de 137 mil registros obtidos de bases abertas (CoRE, CrossRef, OpenAlex, Semantic Scholar) relacionados ao domínio LGBTQIA+ |
Homosaurus (versão 3.3, SKOS) |
Desenvolveram um sistema semiautomático de indexação para um domínio de baixo recurso em bibliotecas indianas. Avaliaram múltiplos backends no Annif (TF-IDF, Omikuji Bonsai/Parabel e Ensemble Neural Network), destacando que tanto o Omikuji quanto o ensemble baseado em redes neurais obtiveram desempenho superior ao TF-IDF, alcançando métricas. Ressalta ainda o potencial do Annif quando aliado a vocabulários especializados. |
|
Ahmed (2023) |
Inglês; registros bibliográficos e metadados do AGRIS (artigos, livros, relatórios técnicos, teses e anais de conferências) |
AGROVOC - Tesauro Multilíngue |
Desenvolve um quadro experimental de indexação automática para o domínio da agricultura, integrando os sistemas AGRIS, AGROVOC e Annif. O estudo treina o Annif com um conjunto de dados de cerca de 99,99% do corpus de 0,82 milhões de registros e testa o Annif com cerca de 0,01% dos 0,82 milhões de registros. O sistema utiliza backends como TF-IDF, fastText, Omikuji e redes neurais para gerar descritores automáticos com base em títulos e resumos. |
|
Golub et al. (2024) |
Sueco e inglês; registros bibliográficos do catálogo nacional Libris |
CDD (Classificação Decimal de Dewey) |
Aplicaram o Annif à CDD em um catálogo nacional. Compararam múltiplos backends: lexicais (TF-IDF e BM25), além de SVC, fastText, Omikuji Bonsai e combinações via ensemble. O melhor desempenho foi obtido com o ensemble, complementado por análise qualitativa sobre o valor das classes automáticas. |
|
Dermentzi et al. (2025) |
Multilíngue (17 idiomas, com predominância de inglês, alemão, francês, hebraico e russo) em descrições arquivísticas do EHRI Portal (metadados de coleções, registros em níveis de coleção a item, baseados no padrão ISAD(G)) |
EHRI Terms, tesauro específico do Holocausto, estruturado em SKOS e expandido para 913 termos em 12 línguas |
Estudo comparativo que avalia abordagens estatísticas, lexicais, ensembles (incluindo o NN Ensemble do Annif) e modelos de LLMs (zero-shot e fine-tuning, como BERT multilíngue). Os resultados mostraram que o ensemble neural do Annif obteve desempenho elevado em métricas de F1, mas os LLMs refinados também se destacaram, revelando potencial para uso em fluxos semi-automáticos de indexação em larga escala. O estudo conclui que, embora promissoras, tais ferramentas são mais adequadas em workflows híbridos (humano-máquina), em linha com os princípios FAIR e a necessidade de maior interoperabilidade entre acervos dispersos. |
|
Kerketta e Mukhopadhyay (2025) |
Inglês; 213.879 registros bibliográficos em formato MARC-21 (títulos, resumos e descritores) |
CDD (Classificação Decimal de Dewey) |
Exploraram o uso do Annif para predição automática de números de classificação na CDD, a partir de registros bibliográficos em formato MARC-21. Treinaram o sistema com um grande corpus e testaram múltiplos backends (fastText, Omikuji, SVC e um ensemble (NN-Ensemble). O modelo ensemble apresentou desempenho superior, avaliado por métricas como F1@5 e NDCG. |
|
Kivimaki et al. (2025) |
Inglês e Finlandês; descrições de cursos universitários (títulos, objetivos de aprendizagem e conteúdos curriculares) |
YSO - Yleinen Suomalainen Ontologia (Ontologia Geral Finlandesa) |
Estudo experimental que aplicou o Annif para geração automática de palavras-chave em descrições de cursos, resultando em 36.124 termos (3.504 únicos). Obteve acurácia de até 64% no corpus em inglês e cerca de 53% em finlandês. Concluiu que o Annif pode apoiar a indexação semiautomática de currículos e catálogos acadêmicos, mas a validação humana é indispensável para garantir precisão e pertinência semântica. |
|
Poley et al. (2025) |
Alemão e Inglês; publicações digitais e impressas da coleção da Biblioteca Nacional da Alemanha (livros, teses, periódicos, e publicações eletrônicas em PDF/EPUB) |
DDC (Dewey Decimal Classification) e GND (Gemeinsame Normdatei) |
O estudo descreve a evolução e a implementação da catalogação automática de assuntos (Automatic Subject Cataloguing) na Deutsche Nationalbibliothek (DNB), detalhando os processos de classificação e indexação baseados em machine learning e abordagens léxicas integradas ao Annif. Apresenta o sistema EMa (Erschließungsmaschine), uma arquitetura modular e de código aberto que combina modelos supervisionados (Omikuji, SVC) e léxicos (MLLM) para atribuir categorias DDC e descritores GND. |
| Suominen, Inkinen e Lehtinen (2025) |
Corpus bilíngue (alemão e inglês) composto por registros bibliográficos do banco de dados TIBKAT, abrangendo diferentes tipos documentais (artigos, livros, teses) |
GND (Gemeinsame Normdatei) |
Apresenta a participação do Annif na tarefa SemEval-2025 Task 5 (LLMs4Subjects), voltada à indexação automática de assuntos em ambiente bilíngue. O estudo combina métodos tradicionais de aprendizado de máquina (Omikuji/Bonsai, MLLM e XTransformer) com técnicas baseadas em LLMs, utilizadas para tradução e geração sintética de dados de treinamento. O artigo também enfatiza a vantagem do baixo custo computacional dos métodos tradicionais e a importância de ampliar o corpus de treinamento e a avaliação qualitativa em futuras pesquisas. |