常用PEFT技术
简要介绍了四种主流的PEFT技术,包括Adapter Tuning,Prefix Tuning,Prompt Tuning和LoRA,这些技术降低了LLM的训练门槛,让普通人也能微调大模型。
简要介绍了四种主流的PEFT技术,包括Adapter Tuning,Prefix Tuning,Prompt Tuning和LoRA,这些技术降低了LLM的训练门槛,让普通人也能微调大模型。
本文介绍了基于Transformer的经典模型,包括Encoder Only架构的BERT模型和Decoder Only架构的GPT系列模型。
大模型时代随着模型规模的增大,对训练技巧的要求也越来越高,本文从正则化方法和正则化位置两个角度,介绍了LLM时代的正则化手段。
介绍了Normalization存在的意义,以及主流的四种Normalization手段,包括Batch Normalization,Layer Normalization,Instance Normalization和Group Normalization。这些Normalization手段都是为了让数据的分布变得更好,从而更好地训练模型。
较为详细地介绍了Transformer模型架构,包括其内部的Multi Head Attention模块,Position-wise Feed Forward模块和Position Embedding模块。Transformer可以说是LLM的基石,需要重点掌握。
简要介绍一下主流的三种Tokenizer,包括Byte Pair Encoding,WordPiece和Unigram Language Model。其中Byte Pair Encoding是很多LLM Tokenizer的基础,需要重点掌握。