Evidence records
Benchmark forecasting from internals plus a 200-pair slice
Store key
campaign.adjudication.FORECAST-CAT The reading
- H-forecast-mae refuted
- H-forecast-beats-size confirmed
registered
- card
- FORECAST-CAT
- status
- adjudicated
- reason
- not measured
- killed
- false
- staged_violation
- false
- pre_freeze_violation
- false
Uncertainty
- ci_low
- not measured
- ci_high
- not measured
- ci_level
- not measured
- n
- not measured
- n_effective
- not measured
- seed_spread
- not measured
- method
- none
Subject
- card
- FORECAST-CAT
- spec
- campaign-forecast-cat
- signals
- not measured
- dataset
- not measured
- readout
- not measured
- frame
- not measured
- interventions
- not measured
- gauge
- invariant
- calibration
- not measured
- observable_version
- 1.0
- trust
- registered
Measurements
metrics
- forecast_mae
- 0.08696
- forecast_mae_minus_size_baseline
- -0.1024
- forecast_mae_minus_size_baseline_ci_low
- -0.1197
- forecast_mae_minus_size_baseline_ci_high
- -0.07469
- size_baseline_mae
- 0.1894
- slice_baseline_mae
- 0.177
thresholds
- H-forecast-mae
- 0.06
- H-forecast-beats-size
- 0
comparators
- H-forecast-mae
- <
- H-forecast-beats-size
- <
kill_thresholds
- K-forecast
- 0
kill_comparators
- K-forecast
- >=
killed_by
No rows returned.
overlay_notes
No rows returned.
Provenance
- git_sha
- f93f4b5578c221d3d2665f9b305f3e86759be862+dirty
- study
- study:campaign-forecast-cat@v1#39a99a5a
- config_hash
- not measured
- gpu_seconds
- 0
- tokens
- 0
- wall_seconds
- 0
- gpu
- cpu
- arc
- reporting
- seeds
- not measured
- oracle_calls
- not measured
- created_at
- parents, Derived from
-
- ev:8b8a7f42976f220d66f185154a639ed4
Rendered on
ev:1acdc14e2fa16124786a9cd0d44a03b2