MARS - NeurIPS 2025

today local_bar

🏛 MARS

2 papers across 2 sessions

Poster Session 4

Thursday, December 4, 2025 · 4:30 PM → 7:30 PM

Exhibit Hall C,D,E

Combining Cost Constrained Runtime Monitors for AI Safety

#1008 · Tim Hua, James Baskerville, Henri Lemoine, Mia Hopman, Aryan Bhatt, Tyler Tracy

Optimally constructing monitoring protocols with multiple monitors of varying costs and performances.

Poster Session 5

Friday, December 5, 2025 · 11:00 AM → 2:00 PM

Exhibit Hall C,D,E

Large language models can learn and generalize steganographic chain-of-thought under process supervision

#1008 · ROBERT MC CARTHY, Joey SKAF, Luis Ibanez-Lissen, Vasil Georgiev, Connor Watts, Hannes Whittingham, Lorena Gonzalez-Manzano, Cameron Tice, Edward Young, Puria Radmard, David Lindner

We show that penalizing certain CoT reasoning makes LLMs learn encoding schemes that generalize to unseen examples.