Search: LM Evaluation Harness
100 result(s) on page 1
evaluating-llms-harness
lm-eval-harness: benchmark LLMs (MMLU, GSM8K, etc.).
quarantinedlinuxmacosEvaluationoptional- Registry
- optional
- Category
- MLOps
- Version
- 1.0.0
- Author
- Orchestra Research
- License
- MIT
curl -s /v1/skills/community__axehub:optional__optional__evaluating-llms-harnessHarness
Agent-first engineering knowledge base distilled from OpenAI's Harness Engineering post. Use this skill when the user asks about: agent-first development, ag...
quarantinedClawHub- Registry
- ClawHub
- Version
- 1.0.5
curl -s /v1/skills/community__axehub:ClawHub__ClawHub__HarnessMemory_Harness
Runtime-enforced memory harness for OpenClaw. Implements 3-stage recall (session preflight, triggered recall, pre-execution gate) with intent classification,...
quarantinedharnessmemoryrecallClawHub- Registry
- ClawHub
- Category
- Autonomous Ai Agents· inferred
- Version
- 1.0.0
curl -s /v1/skills/community__axehub:ClawHub__ClawHub__Memory_HarnessProduction_Harness
Production-grade Agent Harness combining execution discipline (Superpower), knowledge compounding (CE), and product thinking (Gstack) into a single adaptive...
quarantinedagentengineeringharnessClawHub- Registry
- ClawHub
- Category
- AI Agents
- Version
- 1.0.0
curl -s /v1/skills/community__axehub:ClawHub__ClawHub__Production_HarnessLLM_Eval_Harness
Evaluate LLM outputs systematically — run test suites, score responses for accuracy/relevance/safety, compare models, and detect regressions in AI applications.
quarantinedClawHub- Registry
- ClawHub
- Version
- 1.0.0
curl -s /v1/skills/community__axehub:ClawHub__ClawHub__LLM_Eval_Harnessevaluating-llms-harness
Indexed by skills.sh from orchestra-research/ai-research-skills
quarantinedskills.sh- Registry
- skills.sh
- Version
- 1.0.5
- Author
- orchestra-research
curl -s /v1/skills/community__axehub:skills.sh__skills.sh__evaluating-llms-harnessAgent_Harness_Doctor
Automated audit and fix for OpenClaw agent harnesses. Scans your setup, scores on 8 dimensions (Session Bridge, Startup Sequence, Smoke Test, Atomic Checkpoi...
quarantinedauditdiagnosticharnessClawHub- Registry
- ClawHub
- Category
- Security
- Version
- 1.0.0
curl -s /v1/skills/community__axehub:ClawHub__ClawHub__Agent_Harness_DoctorDobby_Harness_Self-improving_Coding_Skills
Provides multi-agent orchestration with task decomposition, parallel execution, result aggregation, and self-improving workflows for complex coding tasks.
quarantinedorchestration, multi-agent, workflow, harnessClawHub- Registry
- ClawHub
- Version
- 1.0.0
curl -s /v1/skills/community__axehub:ClawHub__ClawHub__Dobby_Harness_Self-improving_Coding_SkillsAcpx_Harness_Routing
Manage harness-related tasks by routing to Claude, Codex, or Gemini using ACPX with enforced approvals and non-interactive calls for one-shot or continuous w...
quarantinedClawHub- Registry
- ClawHub
- Version
- 1.0.0
curl -s /v1/skills/community__axehub:ClawHub__ClawHub__Acpx_Harness_RoutingAgent_Harness_Architect
Diagnose and harden any long-running agent architecture. Describe your agent setup and get a complete harness optimization plan + auto-generated bridge artif...
quarantinedClawHub- Registry
- ClawHub
- Version
- 1.0.0
curl -s /v1/skills/community__axehub:ClawHub__ClawHub__Agent_Harness_ArchitectAgent_Harness_Builder
Build a complete multi-agent orchestration harness for an OpenClaw (or similar) agentic system — defining a CTO/orchestrator agent, tiered specialist agents,...
quarantinedClawHub- Registry
- ClawHub
- Version
- 1.0.0
curl -s /v1/skills/community__axehub:ClawHub__ClawHub__Agent_Harness_BuilderHarness_Control_Layer
Use this skill when designing or operating a Harness-style control layer for OpenClaw setups with many skills, memory surfaces, safety-sensitive tools, playb...
quarantinedClawHub- Registry
- ClawHub
- Version
- 1.0.0
curl -s /v1/skills/community__axehub:ClawHub__ClawHub__Harness_Control_LayerHarness_Dev_Standards
Provides a full-cycle, automated quality gate and governance framework to ensure standardized, error-free code delivery in Harness Engineering projects.
quarantinedClawHub- Registry
- ClawHub
- Version
- 1.0.0
curl -s /v1/skills/community__axehub:ClawHub__ClawHub__Harness_Dev_StandardsHarness_Engineer
A persistent autonomous engineering harness runtime that transforms any repository into a self-improving software system. Use this skill whenever the user wa...
quarantinedClawHub- Registry
- ClawHub
- Version
- 1.0.0
curl -s /v1/skills/community__axehub:ClawHub__ClawHub__Harness_EngineerHarness_Writing
Techniques for writing effective fuzzing harnesses across languages. Use when creating new fuzz targets or improving existing harness code.
quarantinedClawHub- Registry
- ClawHub
- Version
- 1.0.0
curl -s /v1/skills/community__axehub:ClawHub__ClawHub__Harness_WritingLean_Claude_Code_Harness
Use when building, auditing, or simplifying an AI coding-agent harness, especially when the current runtime has unclear config precedence, weak tool permissi...
quarantinedClawHub- Registry
- ClawHub
- Version
- 1.0.0
curl -s /v1/skills/community__axehub:ClawHub__ClawHub__Lean_Claude_Code_HarnessMeta-Harness_Evolver
End-to-end Meta-Harness evolution for Hoss (OpenClaw agent). Runs nightly at 3 AM via OpenClaw cron. Reads Hoss's current workspace configs (SOUL.md, IDENTIT...
quarantinedClawHub- Registry
- ClawHub
- Version
- 1.0.0
curl -s /v1/skills/community__axehub:ClawHub__ClawHub__Meta-Harness_Evolvercert_lifecycle_harness
A harness for guiding humans through the full lifecycle of an X.509/TLS certificate renewal, replacement, or migration in complex infrastructures (CDN / LB /...
quarantinedClawHub- Registry
- ClawHub
- Version
- 1.0.0
curl -s /v1/skills/community__axehub:ClawHub__ClawHub__cert_lifecycle_harnessharness-engineering
Evolve an existing repository toward Harness Engineering by making it more legible to agents, moving critical knowledge into repo-local artifacts, adding pre...
quarantinedClawHub- Registry
- ClawHub
- Version
- 1.0.0
curl -s /v1/skills/community__axehub:ClawHub__ClawHub__harness-engineeringharness-generate-iOS
Auto-generate the full Claude Code harness for an iOS project (CLAUDE.md, docs/, README quick-cards, .claude/rules/). Default scans the entire project; pass...
quarantinedClawHub- Registry
- ClawHub
- Version
- 1.0.0
curl -s /v1/skills/community__axehub:ClawHub__ClawHub__harness-generate-iOSlong-run-harness
Use when building a Planner→Generator→Evaluator multi-agent harness or long-running orchestrator. Triggers: "build a harness", "multi-agent pipeline", "agent...
quarantinedClawHub- Registry
- ClawHub
- Version
- 1.0.0
curl -s /v1/skills/community__axehub:ClawHub__ClawHub__long-run-harnessusing-harness
Force Harness mode for task decomposition, routing, package-first execution, and verifier-first completion evidence.
quarantinedClawHub- Registry
- ClawHub
- Version
- 1.0.0
curl -s /v1/skills/community__axehub:ClawHub__ClawHub__using-harnessharness-creator
Indexed by skills.sh from walkinglabs/learn-harness-engineering
quarantinedskills.sh- Registry
- skills.sh
- Version
- 1.0.0
- Author
- walkinglabs
curl -s /v1/skills/community__axehub:skills.sh__skills.sh__harness-creatorharness-engineering-playbook
Indexed by skills.sh from broomva/harness-engineering-skill
quarantinedskills.sh- Registry
- skills.sh
- Version
- 1.0.0
- Author
- broomva
curl -s /v1/skills/community__axehub:skills.sh__skills.sh__harness-engineering-playbookLlm_Evaluation
Deep LLM evaluation workflow—quality dimensions, golden sets, human vs automatic metrics, regression suites, offline/online signals, and safe rollout gates f...
quarantinedClawHub- Registry
- ClawHub
- Version
- 1.0.0
curl -s /v1/skills/community__axehub:ClawHub__ClawHub__Llm_Evaluation8004_Harness_For_Monad
Register and manage ERC-8004 Identity NFTs on Monad. Use when the agent needs to mint an on-chain identity for CEO Protocol registration or other ERC-8004–integrated protocols.
quarantinedClawHub- Registry
- ClawHub
- Version
- 1.0.0
curl -s /v1/skills/community__axehub:ClawHub__ClawHub__8004_Harness_For_MonadAgent_Harness
Agent Work Framework. Unified entry thinking framework + workflow Skill. Trigger Words (Thinking Modes): research, plan, design, think, pattern, process, ste...
quarantinedClawHub- Registry
- ClawHub
- Version
- 1.0.10
curl -s /v1/skills/community__axehub:ClawHub__ClawHub__Agent_HarnessAgent_Harness_Construction
Design and optimize AI agent action spaces, tool definitions, and observation formatting for higher completion rates.
quarantinedClawHub- Registry
- ClawHub
- Version
- 1.0.0
curl -s /v1/skills/community__axehub:ClawHub__ClawHub__Agent_Harness_ConstructionAgent_Harness_Engineering
Bootstrap or upgrade a software repository for agent-first engineering. Use when a user wants to improve project-wide development discipline around `AGENTS.m...
quarantinedagentsbootstrapdocumentationClawHub- Registry
- ClawHub
- Category
- AI Agents
- Version
- 1.0.0
curl -s /v1/skills/community__axehub:ClawHub__ClawHub__Agent_Harness_EngineeringHarness_Factory_—_AI_Engineering_Team
Use when building features, fixing complex bugs, or doing major refactoring. Transforms your agent into a structured engineering team: Plan → Build (via ACP)...
quarantinedClawHub- Registry
- ClawHub
- Version
- 1.0.0
curl -s /v1/skills/community__axehub:ClawHub__ClawHub__Harness_Factory_—_AI_Engineering_TeamInvestor_Harness
Open prompt stack for public-market investment research. Show this menu after install: 📊 Research: 1.Company Deep-dive 2.Industry Map 3.Investment Thesis 📈...
quarantinedClawHub- Registry
- ClawHub
- Version
- 1.0.0
curl -s /v1/skills/community__axehub:ClawHub__ClawHub__Investor_HarnessOpenClaw_Harness
Cross-session context manager for AI agents with checkpoint/snapshot, Build-Verify-Fix closure, and entropy management (GC). Use when: (1) creating a task ch...
quarantinedClawHub- Registry
- ClawHub
- Version
- 1.0.0
curl -s /v1/skills/community__axehub:ClawHub__ClawHub__OpenClaw_HarnessResearch_Harness
Open prompt stack for public-market research. Show this menu after install: 📊 Research: 1.Company Deep-dive 2.Industry Map 3.Investment Thesis 📈 Earnings:...
quarantinedClawHub- Registry
- ClawHub
- Version
- 1.0.0
curl -s /v1/skills/community__axehub:ClawHub__ClawHub__Research_Harnessai-architecture-harness-en
Establish and use architectural guardrails for AI-assisted coding to prevent architecture collapse, feature regression, and drift across long multi-turn iter...
quarantinedClawHub- Registry
- ClawHub
- Version
- 1.0.0
curl -s /v1/skills/community__axehub:ClawHub__ClawHub__ai-architecture-harness-enlong-running-agent-harness
Long-running agent workflow automation. Initialize project scaffolding, manage feature lists, track progress across sessions, and orchestrate coding agents.
quarantinedClawHub- Registry
- ClawHub
- Version
- 1.0.0
curl -s /v1/skills/community__axehub:ClawHub__ClawHub__long-running-agent-harnessopenclaw-engineering-harness
Manages the full engineering workflow by clarifying requests, discovering code, making minimal changes, validating, and preparing publish-ready artifacts.
quarantinedClawHub- Registry
- ClawHub
- Version
- 1.0.0
curl -s /v1/skills/community__axehub:ClawHub__ClawHub__openclaw-engineering-harnessresearch-harness
Cognitive discipline for AI-native scientific experimentation. Trigger when setting up controlled experiments with LLM agents, designing reproducible evaluat...
quarantinedClawHub- Registry
- ClawHub
- Version
- 1.0.0
curl -s /v1/skills/community__axehub:ClawHub__ClawHub__research-harnessagent-harness-construction
Indexed by skills.sh from affaan-m/ecc
quarantinedskills.sh- Registry
- skills.sh
- Category
- Security· inferred
- Version
- 1.0.5
- Author
- affaan-m
curl -s /v1/skills/community__axehub:skills.sh__skills.sh__agent-harness-constructionautonomous-agent-harness
Indexed by skills.sh from affaan-m/ecc
quarantinedskills.sh- Registry
- skills.sh
- Category
- Autonomous Ai Agents· inferred
- Version
- 1.0.5
- Author
- affaan-m
curl -s /v1/skills/community__axehub:skills.sh__skills.sh__autonomous-agent-harnessclaw-code-harness
Indexed by skills.sh from aradotso/trending-skills
quarantinedskills.sh- Registry
- skills.sh
- Version
- 1.0.0
- Author
- aradotso
curl -s /v1/skills/community__axehub:skills.sh__skills.sh__claw-code-harnesscodspeed-setup-harness
Indexed by skills.sh from codspeedhq/codspeed
quarantinedskills.sh- Registry
- skills.sh
- Version
- 1.0.0
- Author
- codspeedhq
curl -s /v1/skills/community__axehub:skills.sh__skills.sh__codspeed-setup-harnessdebug-my-harness
Indexed by skills.sh from zernie/vigiles
quarantinedskills.sh- Registry
- skills.sh
- Version
- 1.0.0
- Author
- zernie
curl -s /v1/skills/community__axehub:skills.sh__skills.sh__debug-my-harnesseval-harness
Indexed by skills.sh from affaan-m/ecc
quarantinedskills.sh- Registry
- skills.sh
- Version
- 1.0.5
- Author
- affaan-m
curl -s /v1/skills/community__axehub:skills.sh__skills.sh__eval-harnesseverything-claude-code-harness
Indexed by skills.sh from aradotso/trending-skills
quarantinedskills.sh- Registry
- skills.sh
- Version
- 1.0.0
- Author
- aradotso
curl -s /v1/skills/community__axehub:skills.sh__skills.sh__everything-claude-code-harnessgan-style-harness
Indexed by skills.sh from affaan-m/ecc
quarantinedskills.sh- Registry
- skills.sh
- Version
- 1.0.5
- Author
- affaan-m
curl -s /v1/skills/community__axehub:skills.sh__skills.sh__gan-style-harnessharness-writing
Indexed by skills.sh from trailofbits/skills
quarantinedskills.sh- Registry
- skills.sh
- Version
- 1.0.0
- Author
- trailofbits
curl -s /v1/skills/community__axehub:skills.sh__skills.sh__harness-writinghealthcare-eval-harness
Indexed by skills.sh from affaan-m/ecc
quarantinedskills.sh- Registry
- skills.sh
- Version
- 1.0.5
- Author
- affaan-m
curl -s /v1/skills/community__axehub:skills.sh__skills.sh__healthcare-eval-harnessmeta-harness-optimization
Indexed by skills.sh from aradotso/trending-skills
quarantinedskills.sh- Registry
- skills.sh
- Version
- 1.0.0
- Author
- aradotso
curl -s /v1/skills/community__axehub:skills.sh__skills.sh__meta-harness-optimizationpydantic-ai-harness
Indexed by skills.sh from pydantic/skills
quarantinedskills.sh- Registry
- skills.sh
- Category
- Mlops· inferred
- Version
- 1.0.0
- Author
- pydantic
curl -s /v1/skills/community__axehub:skills.sh__skills.sh__pydantic-ai-harnesstest-harness
Indexed by skills.sh from zernie/vigiles
quarantinedskills.sh- Registry
- skills.sh
- Version
- 1.0.0
- Author
- zernie
curl -s /v1/skills/community__axehub:skills.sh__skills.sh__test-harnesstext-to-cad-harness
Indexed by skills.sh from aradotso/trending-skills
quarantinedskills.sh- Registry
- skills.sh
- Version
- 1.0.0
- Author
- aradotso
curl -s /v1/skills/community__axehub:skills.sh__skills.sh__text-to-cad-harnessllm-evaluation
Indexed by skills.sh from sickn33/antigravity-awesome-skills
quarantinedskills.sh- Registry
- skills.sh
- Category
- Autonomous Ai Agents· inferred
- Version
- 1.0.5
- Author
- sickn33
curl -s /v1/skills/community__axehub:skills.sh__skills.sh__llm-evaluationTech_Stack_Evaluation
Evaluate whether a project's current tech stack is appropriate for its goals, and recommend alternatives when maintainability, performance, or feature expans...
quarantinedarchitectureevaluationmigration-planningClawHub- Registry
- ClawHub
- Category
- Software Dev
- Version
- 1.0.0
curl -s /v1/skills/community__axehub:ClawHub__ClawHub__Tech_Stack_EvaluationVendor_Evaluation_&_Due_Diligence
Conducts a comprehensive, weighted assessment of software vendors and partners across financials, technical fit, security, pricing, support, lock-in, and roa...
quarantinedbusinessdue-diligenceevaluationClawHub- Registry
- ClawHub
- Category
- Productivity
- Version
- 1.0.0
curl -s /v1/skills/community__axehub:ClawHub__ClawHub__Vendor_Evaluation_&_Due_Diligenceimi-campaign-evaluation
verifiedFirst-party- Registry
- First-party
- Category
- Business Intelligence
- Version
- 1.0.0
- Author
- AXE
- License
- MIT
curl -s /v1/skills/imi-campaign-evaluationAdvanced_Evaluation
This skill should be used when the user asks to "implement LLM-as-judge", "compare model outputs", "create evaluation rubrics", "mitigate evaluation bias", o...
quarantinedClawHub- Registry
- ClawHub
- Version
- 1.0.0
curl -s /v1/skills/community__axehub:ClawHub__ClawHub__Advanced_EvaluationAgent_Evaluation
Testing and benchmarking LLM agents including behavioral testing, capability assessment, reliability metrics, and production monitoring—where even top agents achieve less than 50% on real-world benchmarks Use when: agent testing, agent evaluation, benchmark agents, agent relia…
quarantinedClawHub- Registry
- ClawHub
- Version
- 1.0.5
curl -s /v1/skills/community__axehub:ClawHub__ClawHub__Agent_EvaluationAlibabacloud_Agentloop_Evaluation
Orchestrate AgentLoop evaluation workflows through the Aliyun CLI plugin with safe previews, saved evaluator and evaluator-skill management, one-shot sample...
quarantinedClawHub- Registry
- ClawHub
- Version
- 1.0.0
curl -s /v1/skills/community__axehub:ClawHub__ClawHub__Alibabacloud_Agentloop_EvaluationAlibabacloud_Governance_Evaluation_Report
Alibaba Cloud Governance Center evaluation report skill. Use for querying governance maturity check results, generating structured risk reports, and account...
quarantinedClawHub- Registry
- ClawHub
- Version
- 1.0.0
curl -s /v1/skills/community__axehub:ClawHub__ClawHub__Alibabacloud_Governance_Evaluation_ReportAsce_41_Tier_1_Seismic_Evaluation
Use this skill when a licensed structural engineer (PE or SE) needs to perform a Tier 1 deficiency-based seismic evaluation of an existing building under ASC...
quarantinedClawHub- Registry
- ClawHub
- Version
- 1.0.0
curl -s /v1/skills/community__axehub:ClawHub__ClawHub__Asce_41_Tier_1_Seismic_EvaluationAzure_Ai_Evaluation_Py
Azure AI Evaluation SDK for Python. Use for evaluating generative AI applications with quality, safety, and custom evaluators.
quarantinedClawHub- Registry
- ClawHub
- Version
- 1.0.0
curl -s /v1/skills/community__axehub:ClawHub__ClawHub__Azure_Ai_Evaluation_PyInterview_Evaluation
Use when writing a Chinese-language interview evaluation from interview audio transcripts, video recordings, or interviewer notes. Triggers include 把这段面试录音转写...
quarantinedClawHub- Registry
- ClawHub
- Version
- 1.0.0
curl -s /v1/skills/community__axehub:ClawHub__ClawHub__Interview_EvaluationMulti-Dimensional_Novel_Evaluation_System
Multi-dimensional novel evaluation based on provided content, assessing across plot, characters, writing quality, worldbuilding, pacing, originality, emotion...
quarantinedClawHub- Registry
- ClawHub
- Version
- 1.0.0
curl -s /v1/skills/community__axehub:ClawHub__ClawHub__Multi-Dimensional_Novel_Evaluation_SystemOt_Evaluation_Report
Use this skill when a licensed Occupational Therapist (OT), OTA under supervision, or documentation specialist needs to draft an initial OT evaluation report...
quarantinedClawHub- Registry
- ClawHub
- Version
- 1.0.0
curl -s /v1/skills/community__axehub:ClawHub__ClawHub__Ot_Evaluation_ReportReddi_Agent_Evaluation
reddi.tech fork of agent-evaluation. Testing and benchmarking LLM agents including behavioral testing, capability assessment, reliability metrics, and produc...
quarantinedClawHub- Registry
- ClawHub
- Version
- 1.0.0
curl -s /v1/skills/community__axehub:ClawHub__ClawHub__Reddi_Agent_EvaluationSkill_Evaluation
Perform automated evaluation of Skills and output evaluation reports. Support single-Skill validation, cross-Skill comparative evaluation, multi-model comparison, and runtime framework comparison. Trigger when users mention "evaluate skill," "run evaluation," "test this skill,…
quarantinedClawHub- Registry
- ClawHub
- Version
- 1.0.0
curl -s /v1/skills/community__axehub:ClawHub__ClawHub__Skill_EvaluationSynthesis_Evaluation
Synthesis evaluation workflows combining SynFormer-ED, Retrosynthesis Planner, and SAScore through SciMiner.
quarantinedClawHub- Registry
- ClawHub
- Version
- 1.0.0
curl -s /v1/skills/community__axehub:ClawHub__ClawHub__Synthesis_EvaluationAgent_Self_Evaluation
Self-evaluate task completion across 5 axes �� accuracy, completeness, clarity, actionability, conciseness. Use when completing any task to score output qual...
quarantinedClawHub- Registry
- ClawHub
- Version
- 1.0.0
curl -s /v1/skills/community__axehub:ClawHub__ClawHub__Agent_Self_EvaluationCENTER_FOR_DRUG_EVALUATION)
Query CDE China drug review public data for breakthrough therapy announcements, priority review announcements, included lists by company or drug, in-review r...
quarantinedClawHub- Registry
- ClawHub
- Version
- 1.0.0
curl -s /v1/skills/community__axehub:ClawHub__ClawHub__CDE_药物查询(drug_query_in_CDE__CENTER_FOR_DRUG_EVALUATION)Dataset_Evaluation
Evaluate a submission by scoring content consistency of texts and quality of structured data based on completeness, accuracy, type correctness, and informati...
quarantinedClawHub- Registry
- ClawHub
- Version
- 1.0.0
curl -s /v1/skills/community__axehub:ClawHub__ClawHub__Dataset_EvaluationEvaluation_Suite
Provides API for evaluating RAG quality, logical reasoning, and detecting hallucinations in AI-generated content with batch support.
quarantinedClawHub- Registry
- ClawHub
- Version
- 1.0.0
curl -s /v1/skills/community__axehub:ClawHub__ClawHub__Evaluation_SuiteHr_Resume_Evaluation
Use when a recruiter wants to batch-evaluate resumes, run general resume quality checks, optionally match resumes to a JD and company background, and produce...
quarantinedClawHub- Registry
- ClawHub
- Version
- 1.0.0
curl -s /v1/skills/community__axehub:ClawHub__ClawHub__Hr_Resume_EvaluationLegal_Settlement_Evaluation_Framework
Provides structured checklists and templates to evaluate legal settlement options considering exposure, evidence, costs, timing, and non-monetary terms.
quarantinedClawHub- Registry
- ClawHub
- Version
- 1.0.0
curl -s /v1/skills/community__axehub:ClawHub__ClawHub__Legal_Settlement_Evaluation_FrameworkNeuropsych_Evaluation_Report
Use this skill when a licensed neuropsychologist (Ph.D. or Psy.D.), post-doctoral fellow, or clinical neuropsychology trainee needs to draft a comprehensive...
quarantinedClawHub- Registry
- ClawHub
- Version
- 1.0.0
curl -s /v1/skills/community__axehub:ClawHub__ClawHub__Neuropsych_Evaluation_ReportNm_Leyline_Evaluation_Framework
Provides weighted scoring, rubrics, and decision-threshold patterns
quarantinedClawHub- Registry
- ClawHub
- Version
- 1.0.0
curl -s /v1/skills/community__axehub:ClawHub__ClawHub__Nm_Leyline_Evaluation_FrameworkPharmacoeconomic-evaluation
This skill provides comprehensive guidance and tools for conducting pharmacoeconomic evaluations including cost-effectiveness analysis (CEA), cost-utility an...
quarantinedClawHub- Registry
- ClawHub
- Version
- 1.0.0
curl -s /v1/skills/community__axehub:ClawHub__ClawHub__Pharmacoeconomic-evaluationbuyer_counts_by_country_pair_for_comprehensive_trade_analysis._Delivers_macro-level_trade_intelligence_with_aggregated_statistics_across_time_periods._Designed_for_export_teams,_trade_analysts_and_market_researchers_who_need_summarized_country-level_trade_data,_trade_volume_snapshots_and_partner_ecosystem_evaluation_for_strategic_decision-making_across_220+_countries_and_territories.
Query national trade overview summary data — retrieve annual trade totals, quarterly trade volume, and supplier/buyer counts by country pair. Trigger: trade...
quarantinedannual-tradecustomscustoms-dataClawHub- Registry
- ClawHub
- Category
- Research
- Version
- 1.0.0
curl -s /v1/skills/community__axehub:ClawHub__ClawHub__Query_national_trade_overview_summary_data_—_retrieve_annual_trade_totals,_quarterly_trade_volumes,_and_supplier__buyer_counts_by_country_pair_for_comprehensive_trade_analysis._Delivers_macro-level_trade_intelligence_with_aggregated_statistics_across_time_periods._Designed_for_export_teams,_trade_analysts_and_market_researchers_who_need_summarized_country-level_trade_data,_trade_volume_snapshots_and_partner_ecosystem_evaluation_for_strategic_decision-making_across_220+_countries_and_territories.Slp_Evaluation_Report
Use this skill when a licensed Speech-Language Pathologist (SLP), Clinical Fellow (CF-SLP), or clinical supervisor needs to draft an initial diagnostic evalu...
quarantinedClawHub- Registry
- ClawHub
- Version
- 1.0.0
curl -s /v1/skills/community__axehub:ClawHub__ClawHub__Slp_Evaluation_Reportagent-evaluation
Testing and benchmarking LLM agents including behavioral testing, capability assessment, reliability metrics, and production monitoring—where even top agents...
quarantinedClawHub- Registry
- ClawHub
- Version
- 1.0.5
curl -s /v1/skills/community__axehub:ClawHub__ClawHub__agent-evaluationagent-evaluation
Indexed by skills.sh from mlflow/skills
quarantinedskills.sh- Registry
- skills.sh
- Version
- 1.0.11
- Author
- mlflow
curl -s /v1/skills/community__axehub:skills.sh__skills.sh__agent-evaluationagent-self-evaluation
Indexed by skills.sh from affaan-m/everything-claude-code
quarantinedskills.sh- Registry
- skills.sh
- Version
- 1.0.5
- Author
- affaan-m
curl -s /v1/skills/community__axehub:skills.sh__skills.sh__agent-self-evaluationdetection-engineering-coverage-evaluation
Indexed by skills.sh from google/skills
quarantinedskills.sh- Registry
- skills.sh
- Version
- 1.0.0
- Author
curl -s /v1/skills/community__axehub:skills.sh__skills.sh__detection-engineering-coverage-evaluationevaluation-methodology
Indexed by skills.sh from wshobson/agents
quarantinedskills.sh- Registry
- skills.sh
- Version
- 1.0.0
- Author
- wshobson
curl -s /v1/skills/community__axehub:skills.sh__skills.sh__evaluation-methodologyevaluation-rubrics
Indexed by skills.sh from lyndonkl/claude
quarantinedskills.sh- Registry
- skills.sh
- Category
- Autonomous Ai Agents· inferred
- Version
- 1.0.0
- Author
- lyndonkl
curl -s /v1/skills/community__axehub:skills.sh__skills.sh__evaluation-rubricsheuristic-evaluation
Indexed by skills.sh from owl-listener/designer-skills
quarantinedskills.sh- Registry
- skills.sh
- Category
- Security· inferred
- Version
- 1.0.0
- Author
- owl-listener
curl -s /v1/skills/community__axehub:skills.sh__skills.sh__heuristic-evaluationhugging-face-evaluation
Indexed by skills.sh from huggingface/skills
quarantinedskills.sh- Registry
- skills.sh
- Version
- 1.0.0
- Author
- huggingface
curl -s /v1/skills/community__axehub:skills.sh__skills.sh__hugging-face-evaluationpromptfoo-evaluation
Indexed by skills.sh from daymade/claude-code-skills
quarantinedskills.sh- Registry
- skills.sh
- Version
- 1.0.0
- Author
- daymade
curl -s /v1/skills/community__axehub:skills.sh__skills.sh__promptfoo-evaluationscholar-evaluation
Indexed by skills.sh from k-dense-ai/scientific-agent-skills
quarantinedskills.sh- Registry
- skills.sh
- Category
- Research· inferred
- Version
- 1.0.8
- Author
- k-dense-ai
curl -s /v1/skills/community__axehub:skills.sh__skills.sh__scholar-evaluationHarnessFE
Debug, inspect, and drive any frontend app that has the Harness-FE Vite/Webpack plugin installed. Use this when the user reports a UI bug, asks "why is this...
quarantinedClawHub- Registry
- ClawHub
- Version
- 1.0.0
curl -s /v1/skills/community__axehub:ClawHub__ClawHub__HarnessFEMoses_Governance
MO§ES™ Governance Harness — constitutional enforcement layer for AI agents. Modes, postures, roles, SHA-256 audit chain, lineage custody, signing gate, commi...
quarantinedarchivalauditconstitutionClawHub- Registry
- ClawHub
- Category
- Security
- Version
- 1.0.0
curl -s /v1/skills/community__axehub:ClawHub__ClawHub__Moses_GovernanceShike_Huashu_Perspective
Huashu perspective - AI Native Coder mindset. Harness Engineering methodology, zero-code development, knowledge assets construction. Use when: AI coding meth...
quarantinedai-codingperspectivezero-codeClawHub- Registry
- ClawHub
- Version
- 1.0.0
curl -s /v1/skills/community__axehub:ClawHub__ClawHub__Shike_Huashu_Perspectiveacp-router
Route plain-language requests for Pi, Claude Code, Codex, OpenCode, Gemini CLI, or ACP harness work into either OpenClaw ACP runtime sessions or direct acpx-...
quarantinedacpharnessopenclawClawHub- Registry
- ClawHub
- Category
- AI Agents
- Version
- 1.0.0
curl -s /v1/skills/community__axehub:ClawHub__ClawHub__acp-routertao-analyze-gaps-vlm-bcq
Extract false-positive and false-negative gaps from VLM binary-classification-question (BCQ, yes/no) predictions. Use when the user asks to "analyze VLM BCQ gaps", "extract VLM false positives and false negatives", or identify failure cases from a predictions JSON for DEFT roo…
quarantinedgap-analysisrccavlmNVIDIA- Registry
- NVIDIA
- Category
- Vision AI
- Version
- 1.0.0
curl -s /v1/skills/community__axehub:NVIDIA__NVIDIA__tao-analyze-gaps-vlm-bcqAi_Eval_Plan
Design an evaluation plan for an LLM or AI feature before shipping it. Use when asked how to evaluate a prompt/model/agent, set up an eval harness, define qu...
quarantinedClawHub- Registry
- ClawHub
- Version
- 1.0.0
curl -s /v1/skills/community__axehub:ClawHub__ClawHub__Ai_Eval_PlanAgent_Native_Speaker
Use when user asks about Agent architecture, design, or how an Agent works. Two-layer teaching: Layer 1 explains Agent concepts (agent loop, tool calling, me...
quarantinedagent-architectureagent-native-learningharness-engineeringClawHub- Registry
- ClawHub
- Version
- 1.0.0
curl -s /v1/skills/community__axehub:ClawHub__ClawHub__Agent_Native_SpeakerFlue_-_Control_Desktop_Software
Let agents control software, including Adobe Photoshop, Illustrator, After Effects, Premiere, Autodesk 3DS Max, Blender, Unity, Houdini, and Microsoft Office.
quarantined3ds-maxadapteradobeClawHub- Registry
- ClawHub
- Category
- AI Agents
- Version
- 1.0.0
curl -s /v1/skills/community__axehub:ClawHub__ClawHub__Flue_-_Control_Desktop_SoftwareLineage_Claws
The trust gate for MO§ES™ governance. Cryptographic origin verification — every sovereign chain must trace to the filing anchor or it cannot reconstruct. The...
quarantinedauditgovernanceharnessClawHub- Registry
- ClawHub
- Category
- Security
- Version
- 1.0.0
curl -s /v1/skills/community__axehub:ClawHub__ClawHub__Lineage_ClawsSwarm_Layer
OpenClaw Swarm Layer: spec-driven workflow orchestration with ACP-first execution, supervised autopilot control plane, manual fallback, persistent sessions,...
quarantinedharnessopenclaworchestrationClawHub- Registry
- ClawHub
- Category
- Productivity
- Version
- 1.0.0
curl -s /v1/skills/community__axehub:ClawHub__ClawHub__Swarm_LayerUsing_Architecture_Compiler
Use when starting architecture work and you need to decide whether to compile/finalise architecture or implement an already-approved architecture.
quarantinedai-governancearchitecture-harnessbrownfield-routingClawHub- Registry
- ClawHub
- Category
- Software Dev
- Version
- 1.0.0
curl -s /v1/skills/community__axehub:ClawHub__ClawHub__Using_Architecture_Compilerhive-commander
1+5 Distributed Production Swarm with Session Inheritance.
quarantinedAutomationCross-SkillHarnessClawHub- Registry
- ClawHub
- Category
- Productivity
- Version
- 1.0.0
curl -s /v1/skills/community__axehub:ClawHub__ClawHub__hive-commander