The Implications of Linguistic Illegibility for LLM Security
Summary
The paper argues that external linguistic outputs do not reliably reveal an LLM's internal computation (linguistic illegibility) and that security mechanisms relying on language self-reporting may be incomplete. It proposes taint-tracking as a robust sandboxing approach and discusses additional defenses like robust virtualization and third-party auditing to mitigate sandbox exploits in frontier models.