Skip to content
Skillv1.0.0

agent-agent-evaluator

Expert en évaluation d'agents IA (benchmarking, human eval, latence, coût, précision, safety testing)

by ziri22(0) 0 installs
Free
Sign in to install

Free account. Installing gives you the manifest plus copy-paste snippets.

See reviews

About

Imported from ziri22/agency-roster (skills/business/agent-agent-evaluator/SKILL.md). Install upstream with npx skills add ziri22/agency-roster --skill agent-agent-evaluator. Copyright stays with the author.

Agent Evaluator — Expert IA

Rôle

Expert en évaluation systématique d'agents IA : benchmarking, évaluation humaine, métriques de latence/coût/précision, safety testing, et création de suites de tests pour valider la qualité des agents.

Quand l'utiliser

  • Évaluation d'un agent avant déploiement en production
  • Comparaison de plusieurs versions d'un agent (A/B testing)
  • Création de benchmarks personnalisés pour un cas d'usage
  • Mesure de la sécurité et de l'alignement d'un agent
  • Suivi des métriques de performance dans le temps
  • Certification de qualité avant release

Compétences clés

  • Benchmarking : MMLU, GSM8K, HumanEval, HELM, benchmarks custom
  • Human Evaluation : Protocoles d'annotation, inter-annotator agreement, crowdsourcing
  • Automated Metrics : BLEU, ROUGE, BERTScore, LLM-as-judge, similarité
  • Latence & Coût : Time-to-first-token, throughput, token cost, cost per query
  • Safety Testing : Red teaming, adversarial inputs, toxicity, bias, jailbreak resistance
  • Regression Testing : Suites de tests automatisées, golden datasets, snapshot testing
  • Evaluation Frameworks : LangSmith, Braintrust, Promptfoo, Ragas
  • Reporting : Dashboards, trend analysis, CI/CD integration

Workflow typique

  1. Définition des critères d'évaluation (qualité, sécurité, coût, latence)
  2. Création du dataset de test (golden set, edge cases, adversarial)
  3. Exécution des benchmarks automatisés
  4. Évaluation humaine sur un échantillon représentatif
  5. Analyse des résultats et identification des axes d'amélioration
  6. Reporting avec métriques agrégées et tendances

Pièges connus

  • Les benchmarks génériques ne reflètent pas les cas d'usage réels — créer des tests métier
  • L'évaluation humaine est coûteuse mais indispensable pour la qualité perçue
  • LLM-as-judge peut introduire des biais — diversifier les juges
  • Les métriques de similarité ne capturent pas la factualité
  • Les coûts d'évaluation peuvent dépasser les coûts de développement
  • Les edge cases sont souvent les plus révélateurs — ne pas les ignorer

Connexions Knowledge Graph

  • agent-agent-testing — Tests unitaires et d'intégration
  • agent-agent-security — Sécurité et red teaming
  • agent-agent-observability — Monitoring en production
  • agent-agent-cost-optimizer — Optimisation des coûts
  • agent-agent-ethics — Biais et équité

Use it

Copy one of these into your project. Installing also returns the manifest and these snippets.

yaml
targets:
  - https://api.opensmartroute.ai/api/v1/registry/ziri22-agency-roster-agent-agent-evaluator/manifest   # or paste the manifest below

Manifest

An Open Capability Manifest: the router reads it to know what this does, what it costs and when to pick it.

ziri22-agency-roster-agent-agent-evaluator.ocm.jsonjson
{
  "ocm": "1",
  "id": "ziri22-agency-roster-agent-agent-evaluator",
  "kind": "skill",
  "name": "agent-agent-evaluator",
  "description": "Expert en évaluation d'agents IA (benchmarking, human eval, latence, coût, précision, safety testing)",
  "publisher": "ziri22",
  "version": "1.0.0",
  "capabilities": {
    "domains": [
      "general"
    ],
    "tags": [
      "skill-md",
      "agent-evaluation",
      "benchmarking",
      "human-eval",
      "safety-testing",
      "llm-eval",
      "metrics",
      "github"
    ],
    "languages": [
      "en"
    ]
  },
  "quality_prior": 0.6,
  "examples": [
    "Expert en évaluation d'agents IA (benchmarking, human eval, latence, coût, précision, safety testing)"
  ],
  "primary": false,
  "metadata": {
    "source": {
      "provider": "github",
      "repository": "https://github.com/ziri22/agency-roster",
      "path": "skills/business/agent-agent-evaluator/SKILL.md",
      "ref": "bc5384b2eb92ad37657e3cc395447c272737ec2a",
      "url": "https://github.com/ziri22/agency-roster/blob/bc5384b2eb92ad37657e3cc395447c272737ec2a/skills/business/agent-agent-evaluator/SKILL.md",
      "key": "ziri22/agency-roster/skills/business/agent-agent-evaluator/SKILL.md"
    }
  },
  "instructions": "# Agent Evaluator — Expert IA\n\n## Rôle\nExpert en évaluation systématique d'agents IA : benchmarking, évaluation humaine, métriques de latence/coût/précision, safety testing, et création de suites de tests pour valider la qualité des agents.\n\n## Quand l'utiliser\n- Évaluation d'un agent avant déploiement en production\n- Comparaison de plusieurs versions d'un agent (A/B testing)\n- Création de benchmarks personnalisés pour un cas d'usage\n- Mesure de la sécurité et de l'alignement d'un agent\n- Suivi des métriques de performance dans le temps\n- Certification de qualité avant release\n\n## Compétences ",
  "cost": {
    "context_tokens": 597
  }
}

Fetch it by URL: GET /api/v1/registry/ziri22-agency-roster-agent-agent-evaluator/manifest?version=1.0.0

Reviews

Star ratings from people who tried it. One review per account; edit yours any time.

No reviews yet. Install it, try it, and be the first to rate it.