test-time training
概念词测试时训练
🧠 test-time training 是什么
Test-time training(TTT,测试时训练)的思路很直接:与其让模型带着训练时的旧知识直接面对新输入,不如在推理现场,"临时抱佛脚"——利用当前输入构造无监督学习目标,现场更新一部分模型权重,让模型更好地适应当前任务。
它与 inference-time scaling 的关键区别在于:后者不改变模型参数,只是多算几次;TTT 则真正修改权重,因此能适应训练分布之外的输入(如全新领域的文档、异常分布的数据)。2026 年 TTPO(Test-Time Policy Optimization)解决了 TTT 长期以来的监督信号难题:在没有 ground-truth 标签时,用多数投票的伪标签配合非对称损失,让测试时训练在数学推理等任务上稳定工作。
🔥 为什么现在火
TTPO 提出无需 ground-truth 的测试时策略优化,解决了 TTT 的监督信号难题;推理模型进入'测试时学习'阶段。
📄 证据链(交叉验证)
🔍 搜索形态
test-time training TTT LLM test-time training explained
test-time training 常见问题 FAQ
test-time training 是什么?+
在推理时用当前输入构造无监督目标、现场更新模型权重,让模型适应当前任务——与只增加推理计算量的方法不同,它真正改变模型参数。
TTT 和 RAG 有什么区别?+
RAG 是在推理时检索外部知识放进上下文,不改模型;TTT 是把当前输入当作训练数据更新模型权重,从参数层面适应任务。
test-time training 可以用于什么场景?+
适用于输入分布与训练分布差异大的场景:如医学影像、个性化文档理解、新语言/新领域的推理任务。
与 test-time training 相关的搜索
人们搜索 test-time training 时,还会关心这些问题:
- test-time training 是什么
- 什么是 test-time training
- test-time training 是什么意思
- 测试时训练 是什么
- 测试时训练 详解
- test-time training 原理
- test-time training 怎么工作
- test-time training 有什么用
- test-time training 应用场景
- test-time training 为什么火
- 为什么 test-time training 重要
- test-time training 和 inference-time-scaling 的区别
- test-time training 2026