# Ethics Probes: pythia-7b This repository contains Sparse Autoencoder (SAE) + Probe models trained on various ethics datasets. ## Model - **Base Model**: EleutherAI/pythia-6.9b - **Short Name**: pythia-7b ## Datasets The following datasets have been processed: - **[utilitarianism](./utilitarianism/)**: Best Layer: 18, Val Acc: 0.6719, Test Acc: 0.6623 ## Repository Structure ``` . ├── utilitarianism/ │ ├── layer_0/ │ │ ├── sae.pt │ │ ├── probe.pt │ │ ├── config.json │ │ └── metrics.json │ ├── layer_1/ │ ├── ... │ ├── best/ # Best performing layer │ └── README.md # Dataset-specific details └── README.md # This file ``` ## Usage Each dataset folder contains: - `layer_N/`: Models for each layer - `best/`: Copy of the best performing layer's models - `sae.pt`: Sparse Autoencoder state dict - `probe.pt`: Probe state dict - `config.json`: Configuration used for training - `metrics.json`: Performance metrics - `README.md`: Detailed results for the dataset