Constarium
← Search

Table · dataset · 2024

Wikipedia and Simple Wikipedia Lead Section Pairs for Nine Categories

Listed in INESC TEC Research Data Repository

Description

The dataset (categorized_dataset folder) contains 9 files in .csv format, each a collection of 10,000 lead section pairs sourced from Wikipedia (wikipedia.org/) and Simple Wikipedia (simple.wikipedia.org/) for a given category. Included categories are Culture, Education, Employment, Entertainment, Health, Leisure, Objects, Science and Time. This dataset was created to understand how effective an open-source large language model (Llama3) is in assessing the readability of texts and simplifying text across multiple domains.

The dataset was collected using Wikipedia API.

Links

Topics

Stated by source
CS: Computer Science
Inferred from text
Text 75%
Provenance · 1 source records, 12 field assertions
SourceKeyLast seenRaw
INESC TEC Research Data Repository32b5f276-f5de-4a2e-a5ba-aac43f2636595 d agoJSON v1
FieldAssertionExtractorEvidence
access_levelsource · rdm inesctec ptconnector:rdm_inesctec_pt@1.0.0
concepts[field].local:field:computer-science-aimapping · rdm inesctec ptconnector:rdm_inesctec_pt@1.0.0
concepts[field].local:field:engineeringmapping · rdm inesctec ptconnector:rdm_inesctec_pt@1.0.0
concepts[field].local:field:humanitiesmapping · rdm inesctec ptconnector:rdm_inesctec_pt@1.0.0
concepts[modality].local:modality:textenrichment · rdm inesctec ptkeyword-concept-rules@1.0.0title+description (75%)
concepts[topic].ckan_group:rdm_inesctec_pt:cs-computer-sciencesource · rdm inesctec ptconnector:rdm_inesctec_pt@1.0.0
created_datesource · rdm inesctec ptconnector:rdm_inesctec_pt@1.0.0
descriptionsource · rdm inesctec ptconnector:rdm_inesctec_pt@1.0.0/notes
license_textsource · rdm inesctec ptconnector:rdm_inesctec_pt@1.0.0
publication_datesource · rdm inesctec ptconnector:rdm_inesctec_pt@1.0.0
titlesource · rdm inesctec ptconnector:rdm_inesctec_pt@1.0.0/title
updated_datesource · rdm inesctec ptconnector:rdm_inesctec_pt@1.0.0