零基础学习PPO
本文从强化学习的基本概念讲起,包括马尔可夫决策过程(MDP)、状态价值函数与动作价值函数,再到策略梯度方法、Actor-Critic框架和GAE优势估计,最后详细介绍PPO的裁剪目标函数与实现细节,零基础也能系统理解PPO。
本文从强化学习的基本概念讲起,包括马尔可夫决策过程(MDP)、状态价值函数与动作价值函数,再到策略梯度方法、Actor-Critic框架和GAE优势估计,最后详细介绍PPO的裁剪目标函数与实现细节,零基础也能系统理解PPO。
本文是对网易有道开源的RAG框架QAnything的一个学习笔记,感谢QAnything框架让更多人可以接触到RAG应用。QAnything整体采用了两阶段检索的方案,实现了知识库越大,RAG效果越好的愿景,是非常值得学习的RAG框架。
FlashAttention和PagedAttention是目前主流的两种LLM加速推理算法,了解两者的工作原理有助于更深入地理解LLM。同时,FlashAttention和PagedAttention是两个主流推理加速框架FlashAttention和vLLM的核心算法,了解两者的原理可以帮助更好地使用vLLM和FlashAttention。
介绍了主流的Attention机制,包括Multi-Head Attention,Multi-Query Attention,Grouped-Query Attention和Multi-head Latent Attention。