Pular para o conteúdo
mattpocock/skills

Júri por modelo

LLM como juiz: pontuação direta, comparação pareada, rubrica.

advanced-evaluation
Peso
pesado
410 linhas · 200–600 linhas
Gatilho
o agente chama
O agente dispara sozinho quando a descrição bate com a tarefa.
Encaixe
livre
Combina com 1 outra.

O que ela faz

Quatrocentas e dez linhas — a mais pesada do pacote. Cobre as armadilhas de usar modelo para julgar modelo, que são muitas.

Quando não usar

Não comece por aqui. Checagem determinística é mais barata e resolve mais.

Ficha técnica

Descrição original
This skill should be used for advanced LLM evaluation: LLM-as-judge systems, direct scoring, pairwise comparison, rubric calibration, evaluator bias mitigation, confidence scoring, and automated quality assessment.
Caminho no repo
skills/advanced-evaluation/SKILL.md
SKILL.md
410 linhas
Scripts
sim
Seções
When to Activate · Core Concepts · Evaluation Approaches · Task · Original Prompt · Response to Evaluate · Criteria · Instructions · Output Format · Critical Instructions · Original Prompt · Response A · Response B · Comparison Criteria

Instalar — vem com o pacote inteiro (443 skills)

CLI skills

No terminal, de qualquer diretório.

  1. npx skills@latest add mattpocock/skills

A instalação não liga nada — mas a esteira só funciona inteira depois de rodar /setup-matt-pocock-skills uma vez no repositório, e é ela que grava configuração por projeto.

O que essa instalação faz na sua máquinaFechar

Como o método funciona

O gerenciador da Vercel Labs. Usa o GitHub como registro, copia para ~/.agents/skills e cria symlink para cada agente instalado na máquina.

Precisa ter

  • Node 18+

Onde cai no disco

~/.agents/skills/ + symlink em ~/.claude/skills/

Sair

npx skills remove mattpocock/skills

Do mesmo pacote