-
CLARA-MeD corpus
Una colección de 24 298 pares de textos profesionales y simplificados (>96 millones de tokens): 1) Prospectos de medicamentos y resúmenes de las características del producto (10 211 pares de textos, >82 millones de palabras); 2) Resúmenes de...
Instituto: Instituto de Lengua, Literatura y Antropología (ILLA), CSIC
-
El programa político: ¿Hasta qué punto es una puesta en escena la hostilidad ...
Este conjunto de datos corresponde a la muestra seleccionada aleatoriamente de «The Political Show: ¿Hasta qué punto está teatralizada la hostilidad en el Parlamento español?», https://doi.org/10.1093/pa/gsag035 Este estudio pone a prueba la hipótesis...
Instituto: Instituto de Filosofía (IFS), CSIC
-
El programa político: ¿Hasta qué punto es una puesta en escena la hostilidad ...
Este conjunto de datos corresponde a la muestra seleccionada aleatoriamente de «The Political Show: ¿Hasta qué punto está teatralizada la hostilidad en el Parlamento español?», https://doi.org/10.1093/pa/gsag035 Digital CSIC no tiene acceso a los...
Instituto: Instituto de Filosofía (IFS), CSIC
-
SimpMedLexSp (Simple Medical Lexicon for Spanish)
A medical lexicon of 14013 pairs of technical word forms and the corresponding simplified synonym or definition. It is aimed at automatic text simplification in Spanish. A subset of the lexicon (4642 term entries) was also normalized to Unified Medical...
Instituto: Instituto de Lengua, Literatura y Antropología (ILLA), CSIC
-
Medical Artificial Intelligence text Detection in Multilingual settings (MedA...
Este conjunto de datos se creó recopilando corpus de autoría humana de varios centros de salud pública y generando datos adicionales mediante tres LLM diferentes: GPT-4o, Mistral-7B y Llama3-1. Incluimos textos en inglés, español, alemán y francés del...
Instituto: Instituto de Lengua, Literatura y Antropología (ILLA), CSIC
-
Corpus para la identificación de palabras complejas en textos médicos en espa...
[Descripción de los métodos utilizados para la recopilación/generación de datos] Las estadísticas y los métodos del corpus se explican en el siguiente artículo: Federico Ortega-Riba, Leonardo Campillos-Llanos, Doaa Samy (2025) «Lexical Simplification...
Instituto: Instituto de Lengua, Literatura y Antropología (ILLA), CSIC
-
CT-EBM-SP - Corpus de ensayos clínicos para la medicina basada en la evidenci...
Colección de 1200 textos (292 173 tokens) sobre estudios de ensayos clínicos y anuncios de ensayos clínicos en español: - 500 resúmenes de revistas publicadas bajo licencia Creative Commons disponibles, por ejemplo, en PubMed o Scientific Electronic...
Instituto: Instituto de Lengua, Literatura y Antropología (ILLA), CSIC
-
CT-EBM-SP - Corpus de ensayos clínicos para la medicina basada en la evidenci...
Una colección de 1200 textos (292173 tokens) sobre estudios de ensayos clínicos y anuncios de ensayos clínicos en español: - 500 resúmenes de revistas publicadas bajo una licencia Creative Commons, por ejemplo, disponibles en PubMed o en la Biblioteca...
Instituto: Instituto de Lengua, Literatura y Antropología (ILLA), CSIC
