Jiho Kang
jihokang02
AI & ML interests
Reinforcement learning, reward modeling, RLHF, policy optimization, offline RL
Recent Activity
liked a model about 10 hours ago
jarguello76/reinforcement_learning_lunar_landing upvoted a paper about 10 hours ago
ImpossibleRubrics: Stress-Testing Generated Rubrics as Reward Signals upvoted a paper about 10 hours ago
PARSER: Read in Parallel, Reason in Depth for Long-Context LLM AgentsOrganizations
None yet