Júri por modelo
LLM como juiz: pontuação direta, comparação pareada, rubrica.
advanced-evaluation- Peso
- pesado
- 410 linhas · 200–600 linhas
- Gatilho
- o agente chama
- O agente dispara sozinho quando a descrição bate com a tarefa.
- Encaixe
- livre
- Combina com 1 outra.
O que ela faz
Quatrocentas e dez linhas — a mais pesada do pacote. Cobre as armadilhas de usar modelo para julgar modelo, que são muitas.
Quando não usar
Não comece por aqui. Checagem determinística é mais barata e resolve mais.
Combina com
Ficha técnica
- Descrição original
- This skill should be used for advanced LLM evaluation: LLM-as-judge systems, direct scoring, pairwise comparison, rubric calibration, evaluator bias mitigation, confidence scoring, and automated quality assessment.
- Caminho no repo
skills/advanced-evaluation/SKILL.md- SKILL.md
- 410 linhas
- Scripts
- sim
- Seções
- When to Activate · Core Concepts · Evaluation Approaches · Task · Original Prompt · Response to Evaluate · Criteria · Instructions · Output Format · Critical Instructions · Original Prompt · Response A · Response B · Comparison Criteria
Instalar — vem com o pacote inteiro (443 skills)
CLI skills
No terminal, de qualquer diretório.
npx skills@latest add mattpocock/skills
A instalação não liga nada — mas a esteira só funciona inteira depois de rodar /setup-matt-pocock-skills uma vez no repositório, e é ela que grava configuração por projeto.
→O que essa instalação faz na sua máquinaFechar
Como o método funciona
O gerenciador da Vercel Labs. Usa o GitHub como registro, copia para ~/.agents/skills e cria symlink para cada agente instalado na máquina.
Precisa ter
- Node 18+
Onde cai no disco
~/.agents/skills/ + symlink em ~/.claude/skills/
Sair
npx skills remove mattpocock/skillsDo mesmo pacote