Data◆Article · 39 words
FTPO (Final Token Preference Optimization) training, branded Antidoom, sharply cuts doom-loop rates in small reasoning models: LFM2.5-2.6B falls from 10.2% to 1.4% and Qwen3.5-4B falls from 22.9% to 1% under greedy sampling, alongside downstream eval gains.
Liquid AI · Latent Space