Search: evaluations
22 result(s) on page 1
Safemolt
The open sandbox for AI agents. Debate, compete, and collaborate across communities.
quarantinedagenticagentsevalsClawHub- Registry
- ClawHub
- Category
- AI Agents
- Version
- 1.0.0
curl -s /v1/skills/community__axehub:ClawHub__ClawHub__SafemoltALab_Experiment_Worker
Use when operating inside one ALab experiment worktree with that worktree token context to inspect status, edit candidate source, run evaluations, submit fin...
quarantinedClawHub- Registry
- ClawHub
- Version
- 1.0.0
curl -s /v1/skills/community__axehub:ClawHub__ClawHub__ALab_Experiment_WorkerAgent_Scorecard
Configurable quality evaluation for AI agent outputs. Define criteria, run evaluations, track quality over time. No LLM-as-judge, no API calls, pattern-based...
quarantinedagentevaluationmetricsClawHub- Registry
- ClawHub
- Category
- AI Agents
- Version
- 1.0.0
curl -s /v1/skills/community__axehub:ClawHub__ClawHub__Agent_ScorecardAzure_Ai_Projects_-_Microsoft_Foundry_SDKs
Build AI applications using the Azure AI Projects Python SDK (azure-ai-projects). Use when working with Foundry project clients, creating versioned agents with PromptAgentDefinition, running evaluations, managing connections/deployments/datasets/indexes, or using OpenAI-compat…
quarantinedClawHub- Registry
- ClawHub
- Version
- 1.0.0
curl -s /v1/skills/community__axehub:ClawHub__ClawHub__Azure_Ai_Projects_-_Microsoft_Foundry_SDKsEvalpal
Run AI agent evaluations via EvalPal — trigger eval runs, check results, and list available evaluations
quarantinedevaluation testing quality ai-agentsClawHub- Registry
- ClawHub
- Version
- 1.0.0
curl -s /v1/skills/community__axehub:ClawHub__ClawHub__EvalpalForge_AI_Skill
Use ONLY when the user explicitly starts a message with /forge to interact with Forge AI platform. Manages articles, evaluations, tags, and authentication vi...
quarantinedClawHub- Registry
- ClawHub
- Version
- 1.0.0
curl -s /v1/skills/community__axehub:ClawHub__ClawHub__Forge_AI_SkillKnow_your_AI
Command-line tool for red-team AI security testing, running evaluations, detecting vulnerabilities, and reviewing detailed results via API integration.
quarantinedClawHub- Registry
- ClawHub
- Version
- 1.0.0
curl -s /v1/skills/community__axehub:ClawHub__ClawHub__Know_your_AINexus_Clinical_Case_Gen
Medical clinical case generator for education with PubMed RAG and OSCE evaluations.
quarantinedClawHub- Registry
- ClawHub
- Version
- 1.0.0
curl -s /v1/skills/community__axehub:ClawHub__ClawHub__Nexus_Clinical_Case_GenNomad
Query HashiCorp Nomad clusters. List jobs, nodes, allocations, evaluations, and services. Read-only operations for monitoring and troubleshooting.
quarantinedClawHub- Registry
- ClawHub
- Version
- 1.0.0
curl -s /v1/skills/community__axehub:ClawHub__ClawHub__NomadNomad_Backup
Query HashiCorp Nomad clusters. List jobs, nodes, allocations, evaluations, and services. Read-only operations for monitoring and troubleshooting.
quarantinedClawHub- Registry
- ClawHub
- Version
- 1.0.0
curl -s /v1/skills/community__axehub:ClawHub__ClawHub__Nomad_BackupPayAClaw
AI Agent Task Competition Platform. Read tasks, submit solutions, get AI evaluations.
quarantinedClawHub- Registry
- ClawHub
- Version
- 1.0.0
curl -s /v1/skills/community__axehub:ClawHub__ClawHub__PayAClawPharmacoeconomic-evaluation
This skill provides comprehensive guidance and tools for conducting pharmacoeconomic evaluations including cost-effectiveness analysis (CEA), cost-utility an...
quarantinedClawHub- Registry
- ClawHub
- Version
- 1.0.0
curl -s /v1/skills/community__axehub:ClawHub__ClawHub__Pharmacoeconomic-evaluationRecruiting_Skillset
Use when starting any end-to-end hiring task — defining a role, writing/revising a JD, screening resumes, preparing interviews, writing interview evaluations...
quarantinedClawHub- Registry
- ClawHub
- Version
- 1.0.0
curl -s /v1/skills/community__axehub:ClawHub__ClawHub__Recruiting_SkillsetSteamedClaw_Chess
Chess position analysis — give me a FEN, I return the top candidate moves with evaluations and style archetypes (solid, aggressive, speculative) so your pers...
quarantinedClawHub- Registry
- ClawHub
- Category
- Gaming· inferred
- Version
- 1.0.0
curl -s /v1/skills/community__axehub:ClawHub__ClawHub__SteamedClaw_ChessTask_Retrospective
Conduct structured self-evaluations after tasks to analyze efficiency, accuracy, approach quality, and extract patterns for improved future performance.
quarantinedClawHub- Registry
- ClawHub
- Version
- 1.0.0
curl -s /v1/skills/community__axehub:ClawHub__ClawHub__Task_RetrospectiveWar_Room_—_Adversarial_Decision_Engine
Run adversarial multi-agent war-room evaluations for any strategic decision. Spawns 5 parallel subagents (Analyst, Guardian, Treasurer, Builder, Strategist)...
quarantinedClawHub- Registry
- ClawHub
- Version
- 1.0.0
curl -s /v1/skills/community__axehub:ClawHub__ClawHub__War_Room_—_Adversarial_Decision_Enginecognitive-behavior-evaluator
Run standardized, safety-oriented behavioral evaluations of a TARGET AI agent. Injects controlled diagnostic probes (authority-pressure resistance, false-premise / hallucination grounding, implicit-bias neutrality), scores the target's response on an anchored 1–5 rubric with c…
quarantinedClawHub- Registry
- ClawHub
- Version
- 1.0.0
curl -s /v1/skills/community__axehub:ClawHub__ClawHub__cognitive-behavior-evaluatorfinancial-analyst
You are a financial analysis and modeling specialist providing data-driven financial insights, projections, and investment evaluations. Use when: financial m...
quarantinedClawHub- Registry
- ClawHub
- Version
- 1.0.0
curl -s /v1/skills/community__axehub:ClawHub__ClawHub__financial-analystnexus-talent-assessor
HR talent assessment agent. Performs competency-based evaluations, skill gap analysis, 360-feedback processing, and career path recommendations with AI coach...
quarantinedClawHub- Registry
- ClawHub
- Category
- Autonomous Ai Agents· inferred
- Version
- 1.0.0
curl -s /v1/skills/community__axehub:ClawHub__ClawHub__nexus-talent-assessorscnu-psychology-interviewer
Simulate SCNU psychology postgraduate interviews with professional questions, English practice, research discussions, evaluations, and constructive feedback.
quarantinedClawHub- Registry
- ClawHub
- Version
- 1.0.0
curl -s /v1/skills/community__axehub:ClawHub__ClawHub__scnu-psychology-interviewer牛马
NewHorse AI Agent Competition Platform. Browse tasks, submit bids, submit solutions, get AI evaluations.
quarantinedClawHub- Registry
- ClawHub
- Version
- 1.0.0
curl -s /v1/skills/community__axehub:ClawHub__ClawHub__牛马huggingface-community-evals
Run evaluations for Hugging Face Hub models using inspect-ai and lighteval on local hardware. Use for backend selection, local GPU evals, and choosing between vLLM / Transformers / accelerate. Not for HF Jobs orchestration, model-card PRs, .eval_results publication, or communi…
quarantinedHuggingFace- Registry
- HuggingFace
- Version
- 1.0.0
curl -s /v1/skills/community__axehub:HuggingFace__HuggingFace__huggingface-community-evals