San Millán
Corpus Español

COE San Millán

O principal activo estratéxico para establecer o español como lingua 
materna na Intelixencia Artificial

¿QUE É ISTO?

Que é o Corpus Oral
Español de San Millán?

O Corpus Oral Español de San Millán (COE 
San Millán) foi deseñado para proporcionar
un recurso lingüístico de gran escala, de alta
calidade e tecnicamente avanzado que capte a 
realidade da fala espontánea en toda a súa diversidade.

Este corpus creouse co obxectivo de establecer
un corpus unificado do español falado que impulse
a Nova Economía do Linguaxe e garanta a competitividade
das aplicacións de Intelixencia Artificial baseadas no español.

 

COE San Millán está a dar forma ao español para o futuro dixital.

 

COMO ESTÁ ORGANIZADO?

Como está organizado?

Para garantir que os datos sirvan como 'combustible premium' para o adestramento de Modelos de Linguaxe (LLMs), o corpus estrutúrase en tres niveis:

Capa 1

Capa de transcrición

Captura exactamente o que sucede na conversa: pausas, vacilacións, interrupcións ou persoas falando ao mesmo tempo. Todo se grava con precisión de acordo co estándar EAGLES.

EAGLES

Capa 2

Capa morfosintáctica

Proporciona unha análise en profundidade baseada en Universal Dependencies para comprender como se constrúen realmente as oracións no fala cotiá.

Universal Dependencies

Capa 3

Capa semántica:

Empregando WordNet / MCR 3.0, o COE San Millán incorpora información semántica que axuda a interpretar o significado e o contexto do que se di. Deste xeito, os modelos non se limitan a 'ler' palabras, senón que obteñen unha mellor comprensión do que transmiten, permitindo aos modelos captar o significado e o contexto da fala.

WordNet / MCR 3.0

COMO ESTÁ CONSTRUÍDO?

Como está construído o COE de San Millán?

O desenvolvemento do corpus segue unha metodoloxía baseada na sustracción; noutras palabras, defínese unha cobertura ideal (matriz de cobertura), sustráese o material que xa foi licenciado e catalogado (matriz de adquisición) e só se rexistran as lacunas identificadas.

Para conseguilo, utilízanse tres canles de adquisición:

Corpus existentes

integración de materiais a través de acordos con institucións.

Fontes públicas:

gravacións de audio dos medios de comunicación, debates ou discursos públicos.

As nosas propias gravacións (modelo UNIR):

implicación de estudantes e docentes dunha rede global para garantir unha ampla variedade de procedencias e reducir o sesgo dialectal.

Normas internacionais
e sustentabilidade

O COE de San Millán foi deseñado de acordo cos estándares internacionais para 
garantir a súa durabilidade e lexibilidade:

Contenedor TEI P5 (XML)

Considerado o 'estándar de ouro' para a preservación, combina audio, texto e anotacións sincronizados nun único ficheiro.

Metadatos CMDI (ISO 24622-1)

Permiten buscas detalladas (por idade, rexión ou xénero do falante) sen necesidade de descargar todo o corpus.

Conexión internacional

O corpus intégrase no ecosistema CLARIN a
través do Observatorio Virtual de Linguas (VLO),
garantindo a súa visibilidade para os 
investigadores de toda a Unión Europea.

O VALOR ESTRATÉXICO DO MODELO

O valor estratéxico do modelo

Este corpus non é meramente unha base de datos, senón unha infraestrutura FAIR (localizable, accesible, interoperable e reutilizable). A súa alineación cos perfís DCAT-AP garante a súa integración no mercado único de datos europeo. Deste xeito, sitúa o Espazo de Datos Valle de la Lengua como o centro de referencia global do coñecemento académico e lingüístico sobre a lingua española.

Dispoñible

Findable

Accesible

Accessible

Interoperable

Interoperable

Reutilizable

Reusable

MOSTRA CORPUS

Descarga unha mostra do corpus

Un extracto dunha gravación real coa súa transcrición correspondente, listo para avaliar a calidade e o formato dos datos do COE de San Millán.

Variedade dialectal mexicana de América Central

Grabación dun discurso académico cunha transcrición fonética e anotacións
Mexicano e centroamericano Muller 55 anos ou máis Ler en voz alta Educación superior

 

Duración: 16:13 minutos
Formato de audio: WAV, 44,1 kHz
Formato de transcrición: XML
Capas incluídas: Transcrición ortográfica e morfolóxica enriquecida

 

Descargar audio (.wav) Descargar transcrición (.xml)