2 datasets found
  1. m

    Webis-TLDR-17 Corpus

    • metatext.io
    json
    Updated Jul 16, 2026
    Share
    FacebookFacebook
    TwitterTwitter
    Email
    Click to copy link
    Link copied
    Close
    Cite
    Volske et al. (2026). Webis-TLDR-17 Corpus [Dataset]. https://metatext.io/datasets/webis-tldr-17-corpus
    Explore at:
    jsonAvailable download formats
    Dataset updated
    Jul 16, 2026
    Dataset authored and provided by
    Volske et al.
    Variables measured
    Summarization
    Description

    Dataset contains 3 Million pairs of content and self-written summaries mined from Reddit. It is one of the first large-scale summarization dataset from the social media domain.

  2. h

    tldr-17

    • huggingface.co
    Updated Jun 5, 2023
    Share
    FacebookFacebook
    TwitterTwitter
    Email
    Click to copy link
    Link copied
    Close
    Cite
    Webis Group (2023). tldr-17 [Dataset]. https://huggingface.co/datasets/webis/tldr-17
    Explore at:
    CroissantCroissant is a format for machine-learning datasets. Learn more about this at mlcommons.org/croissant.
    Dataset updated
    Jun 5, 2023
    Dataset authored and provided by
    Webis Group
    License

    Attribution 4.0 (CC BY 4.0)https://creativecommons.org/licenses/by/4.0/
    License information was derived automatically

    Description

    This corpus contains preprocessed posts from the Reddit dataset. The dataset consists of 3,848,330 posts with an average length of 270 words for content, and 28 words for the summary.

    Features includes strings: author, body, normalizedBody, content, summary, subreddit, subreddit_id. Content is used as document and summary is used as summary.

  3. Not seeing a result you expected?
    Learn how you can add new datasets to our index.

Share
FacebookFacebook
TwitterTwitter
Email
Click to copy link
Link copied
Close
Cite
Volske et al. (2026). Webis-TLDR-17 Corpus [Dataset]. https://metatext.io/datasets/webis-tldr-17-corpus

Webis-TLDR-17 Corpus

Explore at:
jsonAvailable download formats
Dataset updated
Jul 16, 2026
Dataset authored and provided by
Volske et al.
Variables measured
Summarization
Description

Dataset contains 3 Million pairs of content and self-written summaries mined from Reddit. It is one of the first large-scale summarization dataset from the social media domain.

Search
Clear search
Close search
Google apps
Main menu