Research1 min read
TrimSFT: Token-Level Loss Reweighting for Mathematical Reasoning SFT
Research indicates that standard SFT over-emphasizes certain tokens during mathematical reasoning, leading to suboptimal training. TrimSFT, a token-level loss reweighting method, improves performance by focusing learning on tokens with intermediate logit gaps, consistently outperforming standard SFT across multiple models and benchmarks.
From arXiv cs.AI