CLARA-MeD corpus

Datos y Recursos

Interoperabilidad


Categorías


Información Adicional

Campo Valor
Identificador http://hdl.handle.net/10261/269887
Autoría
Proyecto
Nombre CLARA-MeD corpus
Descripción

Una colección de 24 298 pares de textos profesionales y simplificados (>96 millones de tokens): 1) Prospectos de medicamentos y resúmenes de las características del producto (10 211 pares de textos, >82 millones de palabras); 2) Resúmenes de información relacionada con el cáncer (201 pares de textos, más de 3 millones de tokens); y 2) Anuncios de ensayos clínicos (5 748 pares de textos, 451 690 tokens). El conjunto de datos también contiene un corpus paralelo con un subconjunto de 3 800 pares de frases en variantes profesionales y para el público general (149 862 tokens). Se trata de un conjunto de datos de referencia para la simplificación de textos médicos. La última descarga de los archivos se realizó en febrero de 2022.

Tipo de dataset
Tipo de acceso
Versión
Temáticas
  • Ciencia y tecnología
  • Salud
Temáticas adicionales [DCAT-AP] Salud
Etiquetas
Fecha de creación 2022-05-19T00:00:00
Fecha última actualización 2022-05-19T00:00:00
Frecuencia de actualización del dataset
Idiomas
  • Español
  • Inglés
Cobertura geográfica España
Cobertura geográfica. Internacional
    Cobertura temporal
    • Desde 2022-05-15 hasta 2022-05-15
    Vigencia del recurso
    Recursos relacionados
    Normativa
      Instituto
      Publicador Publicador - Digital.CSIC
      Observaciones

      Cita recomendada: Campillos-Llanos, Leonardo; Terroba Reinares, Ana Rosa; Zakhir Puig, Sofía; Valverde Mateos, Ana; Capllonch Carrión, Adrián; 2022; CLARA-MeD corpus [Dataset]; DIGITAL.CSIC; https://doi.org/10.20350/digitalCSIC/14644