Evidence records

Benchmark forecasting from internals plus a 200-pair slice

Store key campaign.adjudication.FORECAST-CAT

The reading

  • H-forecast-mae refuted
  • H-forecast-beats-size confirmed

registered

card
FORECAST-CAT
status
adjudicated
reason
not measured
killed
false
staged_violation
false
pre_freeze_violation
false

Uncertainty

ci_low
not measured
ci_high
not measured
ci_level
not measured
n
not measured
n_effective
not measured
seed_spread
not measured
method
none

Subject

card
FORECAST-CAT
spec
campaign-forecast-cat
signals
not measured
dataset
not measured
readout
not measured
frame
not measured
interventions
not measured
gauge
invariant
calibration
not measured
observable_version
1.0
trust
registered

Measurements

metrics

forecast_mae
0.08696
forecast_mae_minus_size_baseline
-0.1024
forecast_mae_minus_size_baseline_ci_low
-0.1197
forecast_mae_minus_size_baseline_ci_high
-0.07469
size_baseline_mae
0.1894
slice_baseline_mae
0.177

thresholds

H-forecast-mae
0.06
H-forecast-beats-size
0

comparators

H-forecast-mae
<
H-forecast-beats-size
<

kill_thresholds

K-forecast
0

kill_comparators

K-forecast
>=

killed_by

No rows returned.

overlay_notes

No rows returned.

Provenance

git_sha
f93f4b5578c221d3d2665f9b305f3e86759be862+dirty
study
study:campaign-forecast-cat@v1#39a99a5a
config_hash
not measured
gpu_seconds
0
tokens
0
wall_seconds
0
gpu
cpu
arc
reporting
seeds
not measured
oracle_calls
not measured
created_at
parents, Derived from

Rendered on

ev:1acdc14e2fa16124786a9cd0d44a03b2