San Millán
Corpus Hispànic
COE San Millán
L'actiu estratègic clau per establir l'espanyol com a llengua materna en la
intel·ligència artificial
¿QUÈ ÉS?
Què és el Corpus Oral
Espanyol de San Millán?
El Corpus Oral d'Espanyol de San Millán (COE San Millán)
ha sigut dissenyat per a proporcionar un recurs lingüístic
d'àmbit ampli, d'alta qualitat i tècnicament avançat que
reculla la realitat del llenguatge espontani en tota la seua diversitat.
Este corpus es va crear amb l'objectiu d'establir un corpus
unificat de castellà parlat que impulse la Nova Economia del
Llenguatge i garantisca la competitivitat de les aplicacions
d'intel·ligència artificial basades en el castellà.
COE San Millán està modelant la llengua espanyola per al futur digital.
COM ESTÀ ORGANITZAT?
Com està organitzat?
Per a garantir que les dades servisquen com a «combustible premium» per a l'entrenament de models lingüístics (LLMs), el corpus s'estructura en tres nivells:
Capa 1
Capa de transcripció
Captura exactament el que passa a la conversa: pauses, vacil·lacions, interrupcions o persones parlant al mateix temps. Tot es registra amb precisió d'acord amb l'estàndard EAGLES.
EAGLES
Capa 2
Capa morfosintàctica
Proporciona una anàlisi en profunditat basada en Universal Dependencies per a entendre com es construïxen realment les oracions en el llenguatge quotidià.
Universal Dependencies
Capa 3
Capa semàntica:
Utilitzant WordNet / MCR 3.0, el COE San Millán incorpora informació semàntica que ajuda a interpretar el significat i el context del que s'està dient. D'esta manera, els models no només 'lligen' paraules, sinó que obtenen una millor comprensió del que transmeten, cosa que els permet captar el significat i el context del discurs.
WordNet / MCR 3.0
COM ESTÀ CONSTRUÏT?
Com està construït el COE de San Millán?
El desenvolupament del corpus seguix una metodologia basada en la sostracció; és a dir, es definix una cobertura ideal (matriu de cobertura), se n'hi sostrau el material que ja ha estat llicenciat i catalogat (matrice d'adquisició) i només s'hi registren les llacunes identificades.
Per a aconseguir-ho, s'utilitzen tres canals d'adquisició:
integració de materials mitjançant acords amb institucions.
enregistraments d'àudio dels mitjans de comunicació, debats o discursos públics.
la participació d'estudiants i professors d'una xarxa global per a garantir una àmplia diversitat d'orígens i reduir els prejudicis dialectals.
Normes internacionals
i sostenibilitat
El COE de San Millán s'ha dissenyat d'acord amb els estàndards internacionals
per garantir-ne la durabilitat i la llegibilitat:
EL VALOR ESTRATÈGIC DEL MODEL
El valor estratègic del model
Este corpus no és només una base de dades, sinó una infraestructura FAIR (Findable, Accessible, Interoperable i Reusable). El seu alineament amb els perfils DCAT-AP garantix la seua integració al Mercat Únic Europeu de dades. Així, establix l'Espai de Dades Valle de la Lengua com a centre global de coneixement acadèmic i lingüístic sobre la llengua espanyola.
Findable
Accessible
Interoperable
Reusable
MOSTRA CORPUS
Descarregueu una mostra del corpus
Un fragment d'enregistrament real amb la seva transcripció corresponent, a punt per avaluar la qualitat i el format de les dades del COE de San Millán.
Enregistrament d'un discurs acadèmic amb una transcripció fonètica i anotacions
Mèxic i Amèrica Central Dona 55 anys o més Llegir en veu alta Educació superior
Durada: 16:13 minuts
Format d'àudio: WAV, 44,1 kHz
Format de transcripció: XML
Capes incloses: Transcripció ortogràfica i morfològica enriquida