Models from the paper "LaSeR: Reinforcement Learning with Last-Token Self-Rewarding"
Wenkai Yang
Keven16
AI & ML interests
None yet
Organizations
None yet
models 18
Keven16/Qwen3-4B-Non-Thinking-RL-Code-Step1200
4B • Updated • 100
Keven16/Qwen3-4B-Non-Thinking-RL-Code-Step300
4B • Updated • 79 • 1
Keven16/Qwen3-4B-Non-Thinking-RL-Math-Step1200
4B • Updated • 344
Keven16/Qwen3-4B-Non-Thinking-RL-Math-Step500
4B • Updated • 274 • 1
Keven16/Qwen2.5-7B-LaSeR
8B • Updated • 2
Keven16/OctoThinker-3B-Short-LaSeR
4B • Updated • 3
Keven16/ORZ-7B-LaSeR
8B • Updated • 4
Keven16/DeepCritic-7B-RL1.5-PRM800K
8B • Updated • 4
Keven16/DeepCritic-7B-RL1.5-Numina
8B • Updated • 5
Keven16/Qwen2.5-32B-TOPS-Iter-DPO-Preview
33B • Updated • 7
datasets 6
Keven16/OPSD-Example-Data
Viewer • Updated • 49.1k • 48
Keven16/G-OPD-Training-Data
Viewer • Updated • 134k • 645 • 3
Keven16/LaSeR_training_data
Viewer • Updated • 104k • 24 • 2
Keven16/TOPS-Data
Preview • Updated • 33
Keven16/DeepCritic-RL-Data
Viewer • Updated • 55k • 19
Keven16/DeepCritic-4.5K
Preview • Updated • 10