Beyond a Bag of Features: Set-Level Instability in Sparse Autoencoders 文章

ArXiv CS.CL2026-08-12PAPERen作者: Nikolai Bolik, Lennart St\"opler, Artur Andrzejak

详细信息

来源站点
ArXiv CS.CL
作者
Nikolai Bolik, Lennart St\"opler, Artur Andrzejak
文章类型
PAPER
语言
en
发布日期
2026-08-12

摘要

arXiv:2608.11197v1 Announce Type: cross Abstract: Shani et al. (2026) show that LLM representations broadly recover human category boundaries, while failing to reflect fine-grained typicality structure. Their analysis uses cosine similarity over dense model representations. We revisit their approach using overlap over active sparse autoencoder (SAE) latent sets as a more interpretable similarity measure. We first verify that this set-level measure is meaningful: SAE latent sets can recover union-like compositional structure in controlled toy models and induce semantically coherent neighborhoods in natural text. Extending the human-concepts analysis to SAE set similarities, we find that SAE activation sets do not recover human category boundaries or within-category typicality more faithfully than dense embeddings or residual-stream states, but instead track model-internal similarity structure.

相关事件

暂无数据

相关公司

暂无数据

相关人物

暂无数据

相关产品

暂无数据