Marketplaces / wshobson/agents / llm-finetuning/grpo-rlvr-training
llm-finetuning/grpo-rlvr-training
Train reasoning and verifiable-task behavior with GRPO and reinforcement learning from verifiable rewards (RLVR). Use when task success is algorithmically checkable (math, code, tool calls, structured output), when designing GRPO reward functions, or when a GRPO run diverges or reward-hacks.
skill · @ 46891e7
Supported tools: all tools
Install in kendex: kendex add --skill llm-finetuning/grpo-rlvr-training after subscribing to wshobson/agents.
Open in app
No app yet? Download kendex.
This package carries no rendered README.