Data as of Jul 25, 2026 · Based on 2,718,867 AI responses across 9,511 prompts · See how Parse measures this
The Pile is an 825 GiB open-source language modeling dataset composed of 22 high-quality sub-datasets, designed to improve cross-domain knowledge and generalization in large language models. It also serves as a robust benchmark for evaluating model performance across diverse domains such as books, code, and scientific papers.
Parse Score