AI & ML interests
Open RL Environments at Scale
Recent Activity
-
The ultimate guide to multi-harness RL
๐206Train open models with RL inside real agent harnesses
-
Multi-harness RL slides
๐9Watch a talk on training coding agents with RL environments
-
SmolDataEnvs Multi-harness | SETA Whitebox
๐งชAnswer dataset questions and view scoring results
-
SmolDataEnvs Multi-harness | Native OpenCode
๐งชRun OpenCode tasks and view grading results
-
FineEnvs/MiMo-V2.6-RL-harbor-code
RL Environment โข Updated โข 9.95k โข 3 -
FineEnvs/MiMo-V2.6-RL-harbor-cyber
RL Environment โข Updated โข 3.52k โข 2 -
FineEnvs/MiMo-V2.6-RL-harbor-general
RL Environment โข Updated โข 3.94k -
FineEnvs/MiMo-V2.6-RL-harbor-terminal
RL Environment โข Updated โข 5.26k
-
Geoguesser Environment
๐1Interact with a GeoGuessrโstyle environment through custom actions
-
FineEnvs/geoguesser-tasks
RL Environment โข Updated โข 3.65k โข 388 -
FineEnvs/geoguesser-qwen3.5-4b-grpo
Image-Text-to-Text โข Updated โข 61 -
FineEnvs/geoguesser-qwen3.5-4b-grpo-v3
Image-Text-to-Text โข Updated โข 74
-
Nayana Multilingual OCR
๐OpenEnv document OCR, layout and VQA over 22 languages
-
FLEURS Multilingual ASR
๐1OpenEnv speech recognition over 102 FLEURS languages
-
FineEnvs/gemma-4-E4B-it-kannada-ocr-grpo
Image-Text-to-Text โข Updated โข 29 -
FineEnvs/gemma-4-E4B-it-kannada-asr-grpo
Automatic Speech Recognition โข Updated โข 28
-
FineEnvs/watercolour-grpo-hps-only
Reinforcement Learning โข Updated โข 24 โข 1 -
FineEnvs/watercolour-reference-pool
RL Environment โข Updated โข 178 โข 1.92k โข 2 -
FineEnvs/watercolour-rollouts-hps-only
RL Environment โข Updated โข 470 โข 822 -
FineEnvs/watercolour-grpo-judge-led
Reinforcement Learning โข Updated โข 26 โข 1
-
The ultimate guide to RL environments: building and scaling them in the LLM era
๐258Building and scaling RL environments for LLM training
-
RL Environments 101 โ Slides
๐43Explore RL Environments 101 slide presentation
-
How to turn a game into an RL environment
๐71From an idea to a trained 4B, with the dead ends left in
-
The ultimate guide to multi-harness RL
๐206Train open models with RL inside real agent harnesses
-
Nayana Multilingual OCR
๐OpenEnv document OCR, layout and VQA over 22 languages
-
FLEURS Multilingual ASR
๐1OpenEnv speech recognition over 102 FLEURS languages
-
FineEnvs/gemma-4-E4B-it-kannada-ocr-grpo
Image-Text-to-Text โข Updated โข 29 -
FineEnvs/gemma-4-E4B-it-kannada-asr-grpo
Automatic Speech Recognition โข Updated โข 28
-
The ultimate guide to multi-harness RL
๐206Train open models with RL inside real agent harnesses
-
Multi-harness RL slides
๐9Watch a talk on training coding agents with RL environments
-
SmolDataEnvs Multi-harness | SETA Whitebox
๐งชAnswer dataset questions and view scoring results
-
SmolDataEnvs Multi-harness | Native OpenCode
๐งชRun OpenCode tasks and view grading results
-
FineEnvs/MiMo-V2.6-RL-harbor-code
RL Environment โข Updated โข 9.95k โข 3 -
FineEnvs/MiMo-V2.6-RL-harbor-cyber
RL Environment โข Updated โข 3.52k โข 2 -
FineEnvs/MiMo-V2.6-RL-harbor-general
RL Environment โข Updated โข 3.94k -
FineEnvs/MiMo-V2.6-RL-harbor-terminal
RL Environment โข Updated โข 5.26k
-
Geoguesser Environment
๐1Interact with a GeoGuessrโstyle environment through custom actions
-
FineEnvs/geoguesser-tasks
RL Environment โข Updated โข 3.65k โข 388 -
FineEnvs/geoguesser-qwen3.5-4b-grpo
Image-Text-to-Text โข Updated โข 61 -
FineEnvs/geoguesser-qwen3.5-4b-grpo-v3
Image-Text-to-Text โข Updated โข 74
-
FineEnvs/watercolour-grpo-hps-only
Reinforcement Learning โข Updated โข 24 โข 1 -
FineEnvs/watercolour-reference-pool
RL Environment โข Updated โข 178 โข 1.92k โข 2 -
FineEnvs/watercolour-rollouts-hps-only
RL Environment โข Updated โข 470 โข 822 -
FineEnvs/watercolour-grpo-judge-led
Reinforcement Learning โข Updated โข 26 โข 1
-
The ultimate guide to RL environments: building and scaling them in the LLM era
๐258Building and scaling RL environments for LLM training
-
RL Environments 101 โ Slides
๐43Explore RL Environments 101 slide presentation
-
How to turn a game into an RL environment
๐71From an idea to a trained 4B, with the dead ends left in
-
The ultimate guide to multi-harness RL
๐206Train open models with RL inside real agent harnesses