HarmonyFidelisHarmonyFidelis
登录
跳转到内容
AURA
理解人工智能配置人工智能公开程序
理解人工智能

基础知识

学习推断

运行机制

表征上下文与记忆架构扩散

进阶研究

推理与智能体世界模型AGI与ASI评估

各板块均可独立浏览,随时查看详细解释。

Aura 首页
Aura理解人工智能架构

Transformer:理解注意力

在合适层次上比较架构、学习方法和完整系统。

要点动手实验深入学习
科学来源
定义

Transformer结合注意力、位置信息与局部变换等组件。循环网络根据连续输入更新状态。架构说明如何计算,学习目标说明优化要改善什么。

缩放点积注意力

Attention(Q,K,V) = softmax(QKᵀ / √dₖ)V

Q包含查询,K包含键,V包含值。QKᵀ除以√dₖ后,逐行softmax产生用于组合V的权重。

01

比较Q和K

Q [n_q × dₖ]
Kᵀ [dₖ × nₖ]
↓
QKᵀ [n_q × nₖ]
02

逐行归一化

softmax(QKᵀ / √dₖ)
[n_q × nₖ]
Σⱼ wᵢⱼ = 1
03

加权组合V

W [n_q × nₖ]
V [nₖ × dᵥ]
↓
O [n_q × dᵥ]

图中只有一个头。Q有n_q行,K和V有nₖ行;Q与K的列数都是dₖ。自注意力中它们由同一序列投影得到。

数值示例:一个查询,三个键

假设与符号

自回归预测中的因果掩码排除未来位置。投影、多头、局部变换层和残差连接共同构成Transformer。注意力权重本身不是行为的因果证据。

解释的局限

扩散方法可以使用不同网络。DreamerV3和MuZero将组件组织成学习与决策系统。这些名称不是可互换的类别。

在正确层次上比较

架构
Transformer · 循环网络
学习/生成方法
监督 · 自监督 · 强化 · 扩散
学习与决策系统
DreamerV3 · MuZero

本页内容

定义公式假设与符号解释的局限科学来源
要点
从概念到应用应用于实践

科学来源

  • Vaswani et al. · 2017Attention Is All You NeedarXiv v7 · 2023
    原始文献
  • Hochreiter & Schmidhuber · 1997Long Short-Term Memory
    原始文献
  • Ho, Jain & Abbeel · 2020Denoising Diffusion Probabilistic Models
    原始文献
  • Jain & Wallace · 2019Attention is not Explanation
    原始文献

基于所引公开资料的教学总结。论文结果受其任务、协议和资源预算约束。

继续探索扩散推断

搜索 Aura

18 个结果

理解人工智能先训练模型,再使用模型区分学到的参数与请求时提供的信息。
理解人工智能从上下文到下一个词元区分模型给出的概率与选择输出的规则。
理解人工智能从文本到表征理解向量,但不把向量等同于人类的意义。
理解人工智能说的是哪种记忆?区分上下文、循环状态、参数与持久存储。
理解人工智能Transformer:理解注意力在合适层次上比较架构、学习方法和完整系统。
理解人工智能通过去噪生成区分训练中的加噪过程与逐步生成。
理解人工智能从模型到行动系统理解模型与工具周围的执行框架。
理解人工智能预测以选择行动探索更长的时域与错误预测的风险。
理解人工智能比较定义,而非寻找唯一裁决使用标签前,先考察通用性、性能与适应能力。
理解人工智能一个结果能支持什么结论从令人信服的印象转向可复现的比较。
配置人工智能准备一个 ChatGPT 项目明确目标、提供有用的上下文,生成真正可用的指令。
配置人工智能根据任务选择工具从需求出发,比较访问能力与结果,不对模型作万能排名。
配置人工智能让请求可以验证将意图整理为目标、上下文与成功标准。
配置人工智能把信息放在正确的位置区分工作规则、任务资料和产品管理的记忆。
配置人工智能准备开发环境定义模型角色、执行环境的能力以及真正需要的访问范围。
配置人工智能组合开发流程组织准备、修改、验证和汇报,复用有帮助的步骤。
配置人工智能准备任务,再验证结果提供可复现的示例、检查清单和观察记录。
公开程序Tentacular公开的用途、功能和相关资料。