Corpus Oral del
Español San Millán

COE San Millán

El activo estratégico clave para situar al español como lengua nativa en la
Inteligencia Artificial

¿QUÉ ES?

¿Qué es el Corpus Oral del Español San Millán?

El Corpus Oral del Español San Millán (COE San Millán) ha sido diseñado para proporcionar un recurso lingüístico masivo, de alta calidad y 
técnicamente avanzado que capture la realidad del habla espontánea en toda su diversidad.

Este corpus nace con el objetivo de crear un corpus unificado de 
español oral que impulse la Nueva Economía de la Lengua y garantice la competitividad de las aplicaciones de Inteligencia Artificial basadas en español.

 

El COE San Millán construye el español del futuro digital.

 

¿CÓMO ESTÁ ORGANIZADO?

¿Cómo está organizado?

Para asegurar que los datos sean "combustible premium" para el entrenamiento de Modelos de Lenguaje (LLMs), el corpus se estructura en tres niveles:

Capa 1

Capa de transcripción

Se recoge exactamente lo que ocurre en la conversación: pausas, dudas, interrupciones o personas hablando a la vez. Todo queda documentado con precisión siguiendo el estándar EAGLES.

EAGLES

Capa 2

Capa de morfosintaxis

Proporciona un análisis profundo basado en Universal Dependencies para entender cómo se construyen realmente las frases en el habla cotidiana.

Universal Dependencies

Capa 3

Capa semántica:

Mediante WordNet / MCR 3.0, el COE San Millán incorpora información semántica que ayuda a interpretar el significado y el contexto de lo que se dice. Así, los modelos no solo “leen” palabras, sino que entienden mejor lo que expresan para que los modelos comprendan el significado y contexto del habla.

WordNet / MCR 3.0

¿CÓMO SE CONSTRUYE?

¿Cómo se construye el COE San Millán?

El desarrollo del corpus sigue una lógica de sustracción metodológica, es decir, se define un ideal de cobertura (matriz de cobertura), se resta el material ya licenciado e inventariado (matriz de obtención) y se graban únicamente los déficits identificados.

Para lograrlo, se utilizan tres vías de captación:

Corpus ya existentes

integración de materiales mediante acuerdos con instituciones.

Fuentes públicas

audios de medios de comunicación, debates o intervenciones públicas.

Grabaciones propias

participación de alumnos y profesores de una red global para asegurar una gran diversidad de perfiles y reducir sesgos dialectales.

Estándares internacionales
y sostenibilidad

El COE San Millán ha sido diseñado bajo estándares internacionales para garantizar
su perdurabilidad y legibilidad:

Contenedor TEI P5 (XML)

Considerado el "estándar de oro" para la preservación, integra en un solo archivo el audio alineado, el texto y las anotaciones.

Metadatos CMDI (ISO 24622-1)

Permiten búsquedas granulares (por edad, región o sexo del hablante) sin necesidad de descargar todo el corpus.

Conexión internacional

El corpus se integra en el ecosistema CLARIN a
través del Virtual Language Observatory (VLO),
asegurando su visibilidad para investigadores de
toda la Unión Europea.

EL VALOR ESTRATÉGICO DEL MODELO

El valor estratégico del modelo

Este corpus no es solo una base de datos, sino una infraestructura FAIR (Localizable, Accesible, Interoperable y Reutilizable). Su alineamiento con los perfiles DCAT-AP garantiza su inmersión en el mercado único europeo de datos. De esta forma, posiciona al Espacio de Datos Valle de la Lengua como el nodo de referencia global del conocimiento académico y lingüístico sobre el español.

Localizable

Findable

Accesible

Accessible

Interoperable

Interoperable

Reutilizable

Reusable

MUESTRA DEL CORPUS

Descarga una muestra del corpus

Un fragmento real de grabación  con su transcripción correspondiente, listo para evaluar la calidad y el formato de los datos del COE San Millán.

Variedad dialectal mexicano centroamericano

Grabación de discurso académico con transcripción ortográfica y anotación
Mexicano centroamericano Mujer Mayor de 55 años Lectura en voz alta Estudios superiores


Duración: 16:13 minutos
Formato audio: WAV, 44,1 kHz
Formato transcripción: XML
Capas incluidas: Transcripción ortográfica enriquecida y morfológica

 

Descargar audio (.wav) | Descargar transcripción (.xml)