San Millán
Corpus Español
COE San Millán
O principal activo estratéxico para establecer o español como lingua
materna na Intelixencia Artificial
¿QUE É ISTO?
Que é o Corpus Oral
Español de San Millán?
O Corpus Oral Español de San Millán (COE
San Millán) foi deseñado para proporcionar
un recurso lingüístico de gran escala, de alta
calidade e tecnicamente avanzado que capte a
realidade da fala espontánea en toda a súa diversidade.
Este corpus creouse co obxectivo de establecer
un corpus unificado do español falado que impulse
a Nova Economía do Linguaxe e garanta a competitividade
das aplicacións de Intelixencia Artificial baseadas no español.
COE San Millán está a dar forma ao español para o futuro dixital.
COMO ESTÁ ORGANIZADO?
Como está organizado?
Para garantir que os datos sirvan como 'combustible premium' para o adestramento de Modelos de Linguaxe (LLMs), o corpus estrutúrase en tres niveis:
Capa 1
Capa de transcrición
Captura exactamente o que sucede na conversa: pausas, vacilacións, interrupcións ou persoas falando ao mesmo tempo. Todo se grava con precisión de acordo co estándar EAGLES.
EAGLES
Capa 2
Capa morfosintáctica
Proporciona unha análise en profundidade baseada en Universal Dependencies para comprender como se constrúen realmente as oracións no fala cotiá.
Universal Dependencies
Capa 3
Capa semántica:
Empregando WordNet / MCR 3.0, o COE San Millán incorpora información semántica que axuda a interpretar o significado e o contexto do que se di. Deste xeito, os modelos non se limitan a 'ler' palabras, senón que obteñen unha mellor comprensión do que transmiten, permitindo aos modelos captar o significado e o contexto da fala.
WordNet / MCR 3.0
COMO ESTÁ CONSTRUÍDO?
Como está construído o COE de San Millán?
O desenvolvemento do corpus segue unha metodoloxía baseada na sustracción; noutras palabras, defínese unha cobertura ideal (matriz de cobertura), sustráese o material que xa foi licenciado e catalogado (matriz de adquisición) e só se rexistran as lacunas identificadas.
Para conseguilo, utilízanse tres canles de adquisición:
integración de materiais a través de acordos con institucións.
gravacións de audio dos medios de comunicación, debates ou discursos públicos.
implicación de estudantes e docentes dunha rede global para garantir unha ampla variedade de procedencias e reducir o sesgo dialectal.
Normas internacionais
e sustentabilidade
O COE de San Millán foi deseñado de acordo cos estándares internacionais para
garantir a súa durabilidade e lexibilidade:
O VALOR ESTRATÉXICO DO MODELO
O valor estratéxico do modelo
Este corpus non é meramente unha base de datos, senón unha infraestrutura FAIR (localizable, accesible, interoperable e reutilizable). A súa alineación cos perfís DCAT-AP garante a súa integración no mercado único de datos europeo. Deste xeito, sitúa o Espazo de Datos Valle de la Lengua como o centro de referencia global do coñecemento académico e lingüístico sobre a lingua española.
Findable
Accessible
Interoperable
Reusable
MOSTRA CORPUS
Descarga unha mostra do corpus
Un extracto dunha gravación real coa súa transcrición correspondente, listo para avaliar a calidade e o formato dos datos do COE de San Millán.
Grabación dun discurso académico cunha transcrición fonética e anotacións
Mexicano e centroamericano Muller 55 anos ou máis Ler en voz alta Educación superior
Duración: 16:13 minutos
Formato de audio: WAV, 44,1 kHz
Formato de transcrición: XML
Capas incluídas: Transcrición ortográfica e morfolóxica enriquecida