深度学习 学习笔记2
深度学习 学习笔记2
循环神经网络
基本RNN
应用场景:专门用于处理序列数据(如时间序列、语音、自然语言文本)
本质特征:拥有“记忆”

W和U在所有时间步中是共享的(可以减少参数量)
问题:长距离依赖问题
-
Deep RNN

在垂直方向堆叠多个RNN隐藏层
-
Bi - RNN

包含两个独立的RNN,一个按时间正序,一个按时间逆序,最后将二者的隐藏状态拼接输出
场景:要有完整上下文,不能实时预测
门控循环单元与长短期记忆网络
-
LSTM
为了解决基本RNN“梯度消失”和长距离依赖问题而生的
- 遗忘门
- 输入门
- 输出门

三大门控机制
-
GRU
简化为两个门
- 重置门:遗忘哪些信息
- 更新门
注意力机制与Transformer模型
自注意力机制
注意力:序列中两个元素之间的相关性程度
优势:解决RNN不可并行性与长距离以来问题
原理:计算Query、Key和Value相似程度来生成属虎人
- Query:当前词汇去查询其他词汇的意向
- Key:被其他词汇查询的“标签与特征”
- Value:当前词汇的实际内容和信息
公式:
- :计算Query与所有Key的相似度
- :将得分转换为概率分布
- :缩放因子,防止Softmax进入梯度饱和区
- 乘以 :加权聚合信息,得到最终上下文表示
多头注意力机制
- Multi-HeadAtention
利用多个查询,来平行计算从输入信息中选取多组信息。每个注意力关注输入信息的不同部分
优势:
- 多视角观察
- 表达增强:类似CNN的多个卷积核,提高对复杂模型的拟合能力
Transformer结构
宏观结构:典型的Encoder-Decoder结构
Positional Encoding,PE:利用正弦和余弦函数的绝对位置编码
Add & Norm:
- Add:残差连接
- Norm:LayerNorm

Encoder:
- Multi-Head Self-Attention
- Feed Forward Network, FFN
Decoder:
-
Masked Multi-Head Attention
- 防止在预测当前词时偷看未来的词
- 将未来位置注意力分数设为
-
Encoder-Decoder Attention
K和V来自Encoder的输出,而Q来自Decoder前一层的疏忽从
-
FFN
Vision Transformer(ViT)模型结构
面向图像处理的Transformer,ViT的主要改变在输入端:
-
图像切片:将完整的图像切割成不重叠的固定大小的块
-
线性展平:将每个Patch展平成一维向量
-
假如特殊Token与位置编码
[class] token:借鉴BERT,在序列最前面加一个科学系的分类token,它的最终输出代表整张图的全局特征
-
送入Transformer Encoder:经过多层Encoder处理后,提取 [class] token 的输出传入MLP进行最终分类
大语言模型与多智能体
大语言模型基础
Large Language Models : Based on Transfoermer 的 Deocer-only结构
涌现能力:模型规模大,可以剧本复杂推理、上下文学习
三阶段:
- Pre-training:自监督学习(学习通用语言规律)
- SFT:在人类指令进行监督学习,使模型学会按照指令回答问题
- RLHF:通过Reward Model引导模型生成更符合人类价值观和偏好的回答
提示工程与RAG
Prompt Engineering:
- Zero-shot:不提供示例
- Few-Shot:提供几个类似的输入输出示例
- Chain of Thought, CoT:通过“让我们一步步思考”,激活模型处理复杂逻辑推理能力
RAG:通过外部知识库检索相关信息
多智能体系统
将复杂任务拆成不同角色定位的Agent
大脑:LLM为核心引擎
记忆:短期(当前对话)、长期(外部database)
工具
规划:反思、CoT、子目标分解
协作机制:降低单体模型的压力
- 角色扮演
- 反思机制

