PEFT & RL Alignment Training
Parameter-efficient fine-tuning (12 methods), reinforcement learning alignment (9 trainers), mixed-precision training, knowledge distillation, and dataset curation
1. Overview
Area
Key Classes
What It Provides
sd.applyPeft(PeftConfig config);
sd.getTrainableParameters();
sd.printTrainableParameters();
sd.distillFrom(SameDiff teacher, DistillationConfig config);
sd.fitGRPO(GRPOConfig config, MultiDataSetIterator data);
sd.saveAdapters(Path dir);
sd.loadAdapters(Path dir);2. Maven Dependencies
3. PEFT Methods
3.1 PeftType Enum
PeftType
Description
3.2 PeftModel
Method
Description
3.3 PeftModelFactory
3.4 LoraLayer
Field
Description
3.5 LoraAdapterCache
3.6 LoftQInitializer
4. LoRA Deep Dive
4.1 LoraConfig
BiasMode
Effect
4.2 QLoraConfig
4.3 AdaLoraConfig — Adaptive Rank Allocation
4.4 DyLoraConfig — Dynamic Rank
4.5 Other Adapter Configs
Config Class
Key Parameters
4.6 Multi-Adapter Serving
4.7 Merge and Unload
5. RL Alignment Trainers
5.1 GRPOTrainer — Group Relative Policy Optimization
Placeholder
Shape
Description
5.2 DPOTrainer — Direct Preference Optimization
5.3 PPOTrainer — Proximal Policy Optimization
5.4 DAPOTrainer — Decoupled Clip and Dynamic Sampling Policy Optimization
5.5 DrGRPOTrainer — Variance-Reduced GRPO
5.6 KTOTrainer — Kahneman-Tversky Optimization
5.7 ORPOTrainer — Odds Ratio Preference Optimization
5.8 SimPOTrainer — Simple Preference Optimization
5.9 GSPOTrainer — Grouped Sampling Policy Optimization
5.10 VlmGRPOTrainer — GRPO for Vision-Language Models
5.11 RewardModelTrainer
Class
Description
6. Training Pipelines
6.1 SFTTrainingPipeline
6.2 RLAlignmentPipeline
6.3 GradientAccumulator
6.4 CheckpointManager
6.5 ContinuedPretrainingWorkflow
7. Mixed Precision Training
7.1 FP8ScaleManager
Tensor direction
FP8 format
Max representable value
7.2 LossScaler — Dynamic Loss Scaling
7.3 Gradient Checkpointing
8. 8-bit Adam Optimizer
Precision
Memory for 7B parameter model
9. Knowledge Distillation
Loss Class
What It Minimizes
10. Dataset Curation Toolkit
10.1 Deduplication
10.2 Benchmark Contamination Removal
10.3 Quality Filtering
10.4 Curriculum Learning
10.5 Sequence Packing
10.6 Domain Mixing
10.7 Padding-Free Batching
10.8 Instruction Formatting and Chat Templates
10.9 Stratified Splitting
11. Transfer Learning API
11.1 Freeze Layers by Name Pattern
11.2 SameDiff-Based Freezing
11.3 TransferLearningHelper — Pre-computed Feature Cache
12. Configuration Reference
LoraConfig
Parameter
Type
Default
Description
GRPOConfig
Parameter
Type
Default
Description
SFTConfig
Parameter
Type
Default
Description
FP8ScaleManager
Parameter
Type
Default
Description
LossScaler
Parameter
Type
Default
Description
Adam8bit
Parameter
Type
Default
Description
DistillationConfig
Parameter
Type
Default
Description
See Also
Last updated
Was this helpful?