github.com/VinAIResearch/BERTweet
BERTweet is the first public large-scale pre-trained language model for English Tweets. It follows the RoBERTa pre-training procedure and is trained on about 850 million English Tweets (including COVID-19 related data), enabling NLP on Twitter text. The project provides several pre-trained models (e.g., bertweet-base, bertweet-large, COVID-19 variants) and tooling to use them with transformers and fairseq.
AI named BERTweet from December 2025 to September 2026.
Brand page for github-com-2181