skill tag
training▌
12 indexed skills · max 10 per page
skills (12)
openrlhf-training
davila7/claude-code-templates · AI/ML
OpenRLHF is a Ray-based RLHF framework optimized for distributed training with vLLM inference acceleration.
simpo-training
davila7/claude-code-templates · AI/ML
SimPO is a reference-free preference optimization method that outperforms DPO without needing a reference model.