VTWM · decoded rollout inspection

Credible Eval — contact-aware loss re-decision

The contact-weight decision was first made on n=3 rollouts. With per-sample metrics + paired Wilcoxon on n=20 val windows, the answer flips: Lc=1.0 is significantly WORSE than the Lc=0.25 baseline. These are the same 20 paired windows decoded per config — watch the tactile gel deformation.

📄 Methods, loss implementation & metric definitions →

How to read. Green = credible best, red = rejected by paired stats. Each config decoded on the SAME 20 val windows (paired). Press ▶ or scrub — the streams stay frame-synced. Full stats + methodology: results page →.

Each video: GT (top) vs model rollout (bottom). See docs/RUNBOOK.md §publish.

L_contact = 0.25 · credible best recommended

Shipped v3_contact. Beats Lc=1.0 on contact MSE (p=0.011), IoU (p=0.024), tactile LPIPS (p=7e-4).

Config recommended

Shipped v3_contact. Beats Lc=1.0 on contact MSE (p=0.011), IoU (p=0.024), tactile LPIPS (p=7e-4).

Rollouts

sample 000
middle view GT · pred
tactile · left GT · pred
tactile · right GT · pred
0/16
sample 001
middle view GT · pred
tactile · left GT · pred
tactile · right GT · pred
0/16
sample 002
middle view GT · pred
tactile · left GT · pred
tactile · right GT · pred
0/16
sample 003
middle view GT · pred
tactile · left GT · pred
tactile · right GT · pred
0/16

no aux · control baseline

No contact-aware loss. Significantly worse on view LPIPS (p=2e-6) — the aux does help, at 0.25.

Config baseline

No contact-aware loss. Significantly worse on view LPIPS (p=2e-6) — the aux does help, at 0.25.

Rollouts

sample 000
middle view GT · pred
tactile · left GT · pred
tactile · right GT · pred
0/16
sample 001
middle view GT · pred
tactile · left GT · pred
tactile · right GT · pred
0/16
sample 002
middle view GT · pred
tactile · left GT · pred
tactile · right GT · pred
0/16
sample 003
middle view GT · pred
tactile · left GT · pred
tactile · right GT · pred
0/16

L_contact = 1.0 · rejected harmful

The n=3 'winner'. At n=20 paired it is significantly WORSE than 0.25 on contact MSE, IoU, tactile LPIPS.

Config harmful

The n=3 'winner'. At n=20 paired it is significantly WORSE than 0.25 on contact MSE, IoU, tactile LPIPS.

Rollouts

sample 000
middle view GT · pred
tactile · left GT · pred
tactile · right GT · pred
0/16
sample 001
middle view GT · pred
tactile · left GT · pred
tactile · right GT · pred
0/16
sample 002
middle view GT · pred
tactile · left GT · pred
tactile · right GT · pred
0/16
sample 003
middle view GT · pred
tactile · left GT · pred
tactile · right GT · pred
0/16

L_contact 1 + L_false (m0.05) · rejected harmful

Activating false-contact suppression: also significantly worse than baseline.

Config harmful

Activating false-contact suppression: also significantly worse than baseline.

Rollouts

sample 000
middle view GT · pred
tactile · left GT · pred
tactile · right GT · pred
0/16
sample 001
middle view GT · pred
tactile · left GT · pred
tactile · right GT · pred
0/16
sample 002
middle view GT · pred
tactile · left GT · pred
tactile · right GT · pred
0/16
sample 003
middle view GT · pred
tactile · left GT · pred
tactile · right GT · pred
0/16
Built by tools/build_inference_site.py from credible_eval.yaml