kendex.ai

Marketplaces / wshobson/agents / llm-finetuning/eval-harness-first

llm-finetuning/eval-harness-first

Build the evaluation harness that gates every fine-tuning run — golden sets, per-failure-mode graders, judge calibration, and base-model baselines. Use when starting a fine-tuning effort, when converting traces into an eval set, or when calibrating a judge against human labels.

skill · safety 100/100 (clean) · @ 367cb6a

Install in kendex: kendex add --skill llm-finetuning/eval-harness-first after subscribing to wshobson/agents.

This package carries no rendered README.