-
Conjunto de datos CorAl: El Corán en aljamiado. Corpus digital de múltiples v...
CorAl (Corán Aljamiado) reúne el corpus completo de ediciones digitales de traducciones aljamiadas del Corán. Permite comparar de forma dinámica las distintas versiones, alineadas entre sí para facilitar su cotejo y análisis. El corpus textual está...
Instituto: Instituto de Lenguas y Culturas del Mediterráneo y Oriente Próximo (ILC), CSIC
-
CLARA-MeD simplified sentences
This dataset contains 1200 manually simplified sentences (144 019 tokens) from clinical trials in Spanish. A total of 1040 announcements from the European Clinical Trials Register (EudraCT) were analyzed to select sentences with ambiguities or...
Instituto: Instituto de Lengua, Literatura y Antropología (ILLA), CSIC
-
SimpMedLexSp (Simple Medical Lexicon for Spanish)
A medical lexicon of 14013 pairs of technical word forms and the corresponding simplified synonym or definition. It is aimed at automatic text simplification in Spanish. A subset of the lexicon (4642 term entries) was also normalized to Unified Medical...
Instituto: Instituto de Lengua, Literatura y Antropología (ILLA), CSIC
-
Deepfakes de audio y medios sintéticos: Lista de lecturas
Esta es una lista de lecturas seleccionadas sobre deepfakes de audio y contenidos digitales sintéticos; es decir, una guía elaborada por expertos que reúne algunas de las publicaciones y recursos más relevantes sobre este tema aparecidos en los últimos...
Instituto: Instituto de Lengua, Literatura y Antropología (ILLA), CSIC
-
Datos cualitativos y cuantitativos de los contextos de uso para el análisis d...
En este registro se incluyen dos documentos, un Excel (menciones_contextos_UT_THC_covid-19.xlsx) con el número de menciones y porcentajes de aparición de los términos objeto de estudio en el corpus y subcorpus de Ciencias Sociales, Ciencias y...
Instituto: Centro de Ciencias Humanas y Sociales (CCHS), CSIC
-
Diccionario Griego-Español en línea
DGE en línea es la edición digital de los siete volúmenes publicados del Diccionario Griego-Español, que cubren la sección alfabética α - ἔξαυος. Aun siendo una obra en curso de elaboración, el DGE constituye en la actualidad el diccionario bilingüe...
Instituto: Instituto de Lenguas y Culturas del Mediterráneo y Oriente Próximo (ILC), CSIC
-
Medical Artificial Intelligence text Detection in Multilingual settings (MedA...
Este conjunto de datos se creó recopilando corpus de autoría humana de varios centros de salud pública y generando datos adicionales mediante tres LLM diferentes: GPT-4o, Mistral-7B y Llama3-1. Incluimos textos en inglés, español, alemán y francés del...
Instituto: Instituto de Lengua, Literatura y Antropología (ILLA), CSIC
-
Corpus para la identificación de palabras complejas en textos médicos en espa...
[Descripción de los métodos utilizados para la recopilación/generación de datos] Las estadísticas y los métodos del corpus se explican en el siguiente artículo: Federico Ortega-Riba, Leonardo Campillos-Llanos, Doaa Samy (2025) «Lexical Simplification...
Instituto: Instituto de Lengua, Literatura y Antropología (ILLA), CSIC
-
CT-EBM-SP - Corpus de ensayos clínicos para la medicina basada en la evidenci...
Colección de 1200 textos (292 173 tokens) sobre estudios de ensayos clínicos y anuncios de ensayos clínicos en español: - 500 resúmenes de revistas publicadas bajo licencia Creative Commons disponibles, por ejemplo, en PubMed o Scientific Electronic...
Instituto: Instituto de Lengua, Literatura y Antropología (ILLA), CSIC
-
CT-EBM-SP - Corpus de ensayos clínicos para la medicina basada en la evidenci...
Una colección de 1200 textos (292173 tokens) sobre estudios de ensayos clínicos y anuncios de ensayos clínicos en español: - 500 resúmenes de revistas publicadas bajo una licencia Creative Commons, por ejemplo, disponibles en PubMed o en la Biblioteca...
Instituto: Instituto de Lengua, Literatura y Antropología (ILLA), CSIC
-
MedTitles - A multimodal dataset of Spanish medical videos and aligned transc...
MedTitles es un conjunto de datos de 30 horas de vídeos y audios médicos en español, sincronizados con los subtítulos correspondientes. Los vídeos se obtuvieron de proveedores médicos autorizados en línea. Contiene los siguientes datos: Un estándar de...
Instituto: Instituto de Lengua, Literatura y Antropología (ILLA), CSIC
-
Medical Lexicon for Spanish (MedLexSp)
MedLexSp es un léxico médico unificado para el procesamiento del lenguaje natural médico en español. Incluye 100.887 lemas, 302.543 formas flexivas (verbos conjugados y variantes de número/género) y 42.958 Unified Medical Language System (UMLS) Concept...
Instituto: Instituto de Lengua, Literatura y Antropología (ILLA), CSIC
-
CLARA-MeD corpus
A collection of 24.298 pairs of professional and simplified texts (>96 million tokens): 1) Drug leaflets and summaries of product characteristics (10 211 pairs of texts, >82M words); 2) Cancer-related information summaries (201 pairs of texts,...
Instituto: Instituto de Lengua, Literatura y Antropología (ILLA), CSIC
