Inference Providers
Active filters: dpo
Avinaash/small_beta6_LR_5e-05_Epoch1_IPO_CuratedDataset
Text Generation
• 0.1B • Updated • 10
Avinaash/small_beta10_LR_5e-05_Epoch1_IPO_CuratedDataset
Text Generation
• 0.1B • Updated • 8
Avinaash/small_beta20_LR_5e-05_Epoch1_IPO_CuratedDataset
Text Generation
• 0.1B • Updated • 15
Avinaash/small_beta60_LR_5e-05_Epoch1_IPO_CuratedDataset
Text Generation
• 0.1B • Updated • 9
Avinaash/small_beta40_LR_2e-05_Epoch1_IPO_CuratedDataset
Text Generation
• 0.1B • Updated • 9
Avinaash/small_beta40_LR_1e-05_Epoch1_IPO_CuratedDataset
Text Generation
• 0.1B • Updated • 11
Avinaash/small_beta40_LR_5e-06_Epoch1_IPO_CuratedDataset
Text Generation
• 0.1B • Updated • 8
Avinaash/full_LR_2e-05_Epoch1_IPO_CuratedDataset
Text Generation
• 0.1B • Updated • 9
Text Generation
• 0.1B • Updated • 13
nomadrp/tp-llama-top200-ws
nomadrp/tp-llama-top200-ss
ammarnasr/SmolLM-135M-GEC-KL-DPO
Text Generation
• 0.1B • Updated • 11
Text Generation
• 0.1B • Updated • 15
Text Generation
• 0.1B • Updated • 10
Text Generation
• 0.1B • Updated • 14
Text Generation
• 0.1B • Updated • 10
Text Generation
• 0.1B • Updated • 11
Text Generation
• 0.1B • Updated • 12
coscotuff/SLFT_Trials_DPO
Text Generation
• 0.1B • Updated • 10
sirsam01/codeit_dpo_model
Text Generation
• 0.1B • Updated • 16
sirsam01/codeit_ipo_model
Text Generation
• 0.1B • Updated • 19
guoqiang-x/zephyr-7b-dpo-qlora
CharlesLi/OpenELM-1_1B-DPO-full-max-10-reward
Text Generation
• 1B • Updated • 17
SameedHussain/gemma-2-2b-it-Flight-Multi-Turn-V3-DPO
Text Generation
• Updated • 12
nomadrp/tp-llama-top200-ws-ss
CharlesLi/OpenELM-1_1B-DPO-full-max-6-reward
Text Generation
• 1B • Updated • 16
rdli/rdl-k8s-4bit_incremental_dpo
Text Generation
• 4B • Updated • 10
CharlesLi/OpenELM-1_1B-DPO-full-max-8-reward
Text Generation
• 1B • Updated • 16
CharlesLi/OpenELM-1_1B-DPO-full-max-14-reward
Text Generation
• 1B • Updated • 17
mradermacher/gemma-2-2b-it-Flight-Multi-Turn-V3-DPO-GGUF
3B • Updated • 578