Jiho Kang
jihokang02
AI & ML interests
Reinforcement learning, reward modeling, RLHF, policy optimization, offline RL
Recent Activity
liked a model 2 days ago
jarguello76/reinforcement_learning_lunar_landing upvoted a paper 2 days ago
ImpossibleRubrics: Stress-Testing Generated Rubrics as Reward Signals upvoted a paper 2 days ago
PARSER: Read in Parallel, Reason in Depth for Long-Context LLM AgentsOrganizations
None yet