深度学习 学习笔记2

循环神经网络

基本RNN

应用场景:专门用于处理序列数据(如时间序列、语音、自然语言文本)

本质特征:拥有“记忆”

image-20260802213045095

ht=f(Wxt+Uht1+b)h_t=f(Wx_{t}+Uh_{t-1}+b)

W和U在所有时间步中是共享的(可以减少参数量)

问题:长距离依赖问题


  • Deep RNN

    image-20260802213215037

    在垂直方向堆叠多个RNN隐藏层

  • Bi - RNN

    image-20260802213240544

    包含两个独立的RNN,一个按时间正序,一个按时间逆序,最后将二者的隐藏状态拼接输出

    场景:要有完整上下文,不能实时预测

门控循环单元与长短期记忆网络

  • LSTM

    为了解决基本RNN“梯度消失”和长距离依赖问题而生的

    • 遗忘门
    • 输入门
    • 输出门

    image-20260802213338758

    三大门控机制

  • GRU

    简化为两个门

    • 重置门:遗忘哪些信息
    • 更新门

注意力机制与Transformer模型

自注意力机制

注意力:序列中两个元素之间的相关性程度

优势:解决RNN不可并行性与长距离以来问题

原理:计算Query、Key和Value相似程度来生成属虎人

  • Query:当前词汇去查询其他词汇的意向
  • Key:被其他词汇查询的“标签与特征”
  • Value:当前词汇的实际内容和信息

公式:

Attention(Q,K,V)=softmax(QKTdk)V\text{Attention}(Q,K,V)=\text{softmax}\left(\frac{QK^T}{\sqrt{d_k}}\right)V

  • QKTQK^T:计算Query与所有Key的相似度
  • Softmax\text{Softmax}:将得分转换为概率分布
  • dk\sqrt{d_k}:缩放因子,防止Softmax进入梯度饱和区
  • 乘以 VV:加权聚合信息,得到最终上下文表示

多头注意力机制

  • Multi-HeadAtention

利用多个查询,来平行计算从输入信息中选取多组信息。每个注意力关注输入信息的不同部分

优势:

  • 多视角观察
  • 表达增强:类似CNN的多个卷积核,提高对复杂模型的拟合能力

Transformer结构

宏观结构:典型的Encoder-Decoder结构

Positional Encoding,PE:利用正弦和余弦函数的绝对位置编码

Add & Norm:

  • Add:残差连接
  • Norm:LayerNorm

image-20260802214227602

Encoder:

  • Multi-Head Self-Attention
  • Feed Forward Network, FFN

Decoder:

  • Masked Multi-Head Attention

    • 防止在预测当前词时偷看未来的词
    • 将未来位置注意力分数设为 -\infty
  • Encoder-Decoder Attention

    K和V来自Encoder的输出,而Q来自Decoder前一层的疏忽从

  • FFN

Vision Transformer(ViT)模型结构

面向图像处理的Transformer,ViT的主要改变在输入端:

  1. 图像切片:将完整的图像切割成不重叠的固定大小的块

  2. 线性展平:将每个Patch展平成一维向量

  3. 假如特殊Token与位置编码

    [class] token:借鉴BERT,在序列最前面加一个科学系的分类token,它的最终输出代表整张图的全局特征

  4. 送入Transformer Encoder:经过多层Encoder处理后,提取 [class] token 的输出传入MLP进行最终分类

大语言模型与多智能体

大语言模型基础

Large Language Models : Based on Transfoermer 的 Deocer-only结构

涌现能力:模型规模大,可以剧本复杂推理、上下文学习

三阶段:

  1. Pre-training:自监督学习(学习通用语言规律)
  2. SFT:在人类指令进行监督学习,使模型学会按照指令回答问题
  3. RLHF:通过Reward Model引导模型生成更符合人类价值观和偏好的回答

提示工程与RAG

Prompt Engineering:

  • Zero-shot:不提供示例
  • Few-Shot:提供几个类似的输入输出示例
  • Chain of Thought, CoT:通过“让我们一步步思考”,激活模型处理复杂逻辑推理能力

RAG:通过外部知识库检索相关信息

多智能体系统

将复杂任务拆成不同角色定位的Agent

大脑:LLM为核心引擎

记忆:短期(当前对话)、长期(外部database)

工具

规划:反思、CoT、子目标分解

协作机制:降低单体模型的压力

  • 角色扮演
  • 反思机制

image-20260802215238949