today local_bar

Hannes Whittingham

Independent Researcher, LASR Labs

2 papers at NeurIPS 2025

OpenReview· Semantic Scholar· Google Scholar

Poster Session 4

Thursday, December 4, 2025 · 4:30 PM → 7:30 PM

Exhibit Hall C,D,E

CoT Red-Handed: Stress Testing Chain-of-Thought Monitoring

#1512 · Benjamin Arnav, Pablo Bernabeu-Perez, Nathan Helm-Burger, Timothy Kostolansky, Hannes Whittingham, Mary Phuong

Poster Session 5

Friday, December 5, 2025 · 11:00 AM → 2:00 PM

Exhibit Hall C,D,E

Large language models can learn and generalize steganographic chain-of-thought under process supervision

#1008 · Robert McCarthy, Joey SKAF, Luis Ibanez-Lissen, Vasil Georgiev, Connor Watts, Hannes Whittingham, Lorena Gonzalez-Manzano, Cameron Tice, Edward James Young, Puria Radmard, David Lindner

We show that penalizing certain CoT reasoning makes LLMs learn encoding schemes that generalize to unseen examples.