Benchmarks & Model Cards
Comparability is machine-enforced
from any_guardrail import BenchmarkResult, BenchmarkSource, ComparisonCohort
result = BenchmarkResult(
guardrail="deepset",
category="prompt_injection",
value=0.91,
source=BenchmarkSource(kind="published", url="https://huggingface.co/deepset/deberta-v3-base-injection"),
cohort=ComparisonCohort(
dataset="deepset-prompt-injections",
dataset_revision="test",
label_mapping="injection=positive",
metric="f1",
threshold_policy="f1@0.5",
harness="published:model-card",
),
contamination=True, # deepset trained on this dataset
)
assert result.value == 0.91
assert result.source.kind == "published"Adding numbers
Last updated