定义
训练通过调整参数来降低损失或增加奖励。目标、数据与优化过程决定学到什么。推断时,模型利用已有参数和可用上下文计算输出。
公式
θ表示参数,L表示损失函数,η表示学习率。这是梯度下降更新的示例,并非所有系统都采用相同规则。
假设与符号
θ表示参数,L表示损失函数,η表示学习率。这是梯度下降更新的示例,并非所有系统都采用相同规则。
解释的局限
修改指令会改变输入,但不一定重新训练参数。监督学习、自监督学习和强化学习是学习方法,不是架构。
区分学到的参数与请求时提供的信息。
训练通过调整参数来降低损失或增加奖励。目标、数据与优化过程决定学到什么。推断时,模型利用已有参数和可用上下文计算输出。
θ表示参数,L表示损失函数,η表示学习率。这是梯度下降更新的示例,并非所有系统都采用相同规则。
θ表示参数,L表示损失函数,η表示学习率。这是梯度下降更新的示例,并非所有系统都采用相同规则。
修改指令会改变输入,但不一定重新训练参数。监督学习、自监督学习和强化学习是学习方法,不是架构。
基于所引公开资料的教学总结。论文结果受其任务、协议和资源预算约束。