LLMs2 min read
SynthSentry: Corpus Contamination Detection for Language Models
SynthSentry is a model-agnostic tool for detecting synthetic data contamination in language model training corpora. It analyzes lexical diversity, n-gram tails, and perplexity variance across reference models, offering a pre-training screening method without requiring access to the generating model.
From arXiv cs.CL
