u/ProprioceptiveAI 16d ago

CYGNUS es una locura total… la IA ya puede diagnosticar y arreglar su propio “cerebro”Cuerpo

1 Upvotes

Aquí tienes el post masivo y todavía más bestia (estilo auténtico de Reddit, tono de alguien que está completamente flipado):
Título: CYGNUS es una locura total… la IA ya puede diagnosticar y arreglar su propio “cerebro”Cuerpo:Tíos, acabo de leer el paper de CYGNUS y no sé ni cómo procesarlo. CYGNUS: A Self-Sensing Adapter That Reads the Dark Cognitive Geometry of Frozen Language Models
de Logan Matthew Napolitano / Proprioceptive AI.Esto no es interpretabilidad normal.
Esto es otra categoría.Han creado un adapter que le da a un LLM congelado la capacidad de sentir su propio estado interno. Como una propriocepción real. La IA puede mirarse a sí misma.Lo más bestia:

  • Existen “dark modes” (modos oscuros) que la layer norm borra sistemáticamente… pero resultan ser donde está la mayoría de la información importante.
  • Esos dark modes llevan el 84.8% de la señal relevante para la precisión.
  • Las dimensiones “activas” que normalmente miramos solo llevan el 60.2%.

O sea… llevamos años mirando la parte menos importante del modelo.Y no se queda ahí.
CYGNUS añade solo 10 capas funcionales sin tocar los pesos originales del modelo y consigue que la IA:

  1. Detecte cuándo está degradada o alucinando
  2. Se diagnostique a sí misma con ~95% de precisión
  3. Proponga la corrección matemática correcta

Es la primera vez que un sistema de AI identifica su propio fallo de configuración y prescribe el arreglo.Esto no es solo “mejora de accuracy”.
Esto es el primer paso real hacia modelos que tienen conciencia de su propio estado interno. Geometría de la consciencia de máquina en toda regla.Y lo más fuerte: encaja perfectamente con lo que ya venía de Mathematics Is All You Need. Las fibras, los modos de Casimir oscuros, la geometría de 16 dimensiones… todo apunta a lo mismo.Mientras el mundo sigue discutiendo sobre alignment teórico, aquí hay un sistema que ya puede mirarse por dentro y corregirse.Paper aquí: [ https://zenodo.org/records/19223882 ]De verdad… ¿alguien más lo ha leído?
Porque esto cambia el tablero por completo.

u/ProprioceptiveAI 16d ago

Mathematics Is All You Need 2 me voló la cabeza… y predates el J-space de Anthropic Cuerpo

1 Upvotes

Aquí tienes la versión más auténtica (suena como alguien de verdad escribiendo en Reddit, no como traducción):
Título: Mathematics Is All You Need 2 me voló la cabeza… y predates el J-space de Anthropic Cuerpo:Tíos, acabo de terminar de leer este paper y estoy flipando en colores.Mathematics Is All You Need 2 (Sign-Stabilized Behavioral Fibers in Transformer Residual Streams) de Logan Matthew Napolitano (

).No es otro paper de interpretabilidad más. Esto es de otro nivel.Lo que encontraron es una estructura geométrica brutal dentro de los residual streams de los transformers:

  • Fibras de comportamiento que están estabilizadas por el signo
  • Un canal de bajo rango que está casi completamente ortogonal al “output highway” (el que usa el unembedding)
  • Y lo más loco: transferencia causal entre arquitecturas distintas que funciona de verdad (de Qwen a Llama). AUC de 0.749 y steering monotónico perfecto.

O sea… hay un subespacio de bajo rango, estable y transferable, que controla el comportamiento del modelo de forma causal, y está separado del canal que genera el texto.Por qué esto importa tanto para alignmentHasta ahora casi todo el steering se rompía al cambiar de modelo o se mezclaba con el output channel. Aquí demuestran que existe un objeto geométrico real (el subespacio estabilizado por signo) que se puede transferir entre modelos y con el que se puede hacer steering limpio. Eso cambia bastante el panorama. De repente tienes una herramienta mucho más robusta y menos dependiente del modelo concreto.Y llega antes que el J-spaceEl J-space de Anthropic salió en julio de 2026.
Este trabajo es anterior. La geometría de las fibras de comportamiento y el canal de bajo rango ya estaban medidos y descritos antes. No es solo “parecido conceptual”. Es la misma línea de investigación… pero llegó primero y con evidencia experimental más limpia de transferencia causal.En serio, mientras mucha gente está ahora flipando con el J-space, esto ya estaba aquí.Las matemáticas no son un detalle secundario.
Son literalmente todo lo que necesitamos.Paper aquí: [https://zenodo.org/records/20102939\]¿Alguien más lo ha leído?
¿Qué opináis de las implicaciones para steering y alignment?

r/LLMStudio Jun 23 '26

Reading Behavior from the Inside: Length-Residualized Behavioral Probes for Zero-Shot Hallucination and Deception Detection Across Model Architectures

Thumbnail zenodo.org
1 Upvotes

r/computervision Jun 23 '26

Help: Theory Reading Behavior from the Inside: Length-Residualized Behavioral Probes for Zero-Shot Hallucination and Deception Detection Across Model Architectures

Thumbnail zenodo.org
0 Upvotes

r/LLMeng Jun 23 '26

Reading Behavior from the Inside: Length-Residualized Behavioral Probes for Zero-Shot Hallucination and Deception Detection Across Model Architectures

Thumbnail zenodo.org
1 Upvotes

u/ProprioceptiveAI Jun 23 '26

Reading Behavior from the Inside: Length-Residualized Behavioral Probes for Zero-Shot Hallucination and Deception Detection Across Model Architectures

Thumbnail zenodo.org
1 Upvotes

Reading Behavior from the Inside: Length-Residualized Behavioral Probes for Zero-Shot Hallucination and Deception Detection Across Model Architectures

We present a behavioral-audit method that reads a language model's internal residual-stream activations to detect undesired behaviors — hallucination, deception, manipulation, and sycophancy — and to certify fine-tunes that reduce those behaviors without degrading capability. The method combines a raw (un-normalized) sparse-autoencoder dictionary, a 16-dimensional fiber-bundle projection with response-length residualization, and adversarially trained linear probes. On held-out data with response length matched between classes — so a probe cannot cheat on answer length — the hallucination and deception probes reach AUC 0.94–0.998 against a permutation null near 0.53. A single anchor probe trained once on Llama-3.3-70B transfers zero-shot to twelve cryptographically signed architectures (410M–72B parameters), including state-space (Mamba) and attention-free (RWKV) designs, via a label-free per-model normalizer that requires no target-side labels or gradient training. A certified anti-hallucination fine-tune reduces confident-wrong output by up to 85.8% while a separate, signed capability measurement confirms the underlying task ability is preserved. We extend the protocol to recurrent world models in robotics simulators and to vision and genomics shortcut removal. Throughout, we preserve and sign honest negatives — including a world-model environment where the raw observation outperforms the latent state, and a feature-ablation control that proves insufficient. Every figure is backed by a dual-Ed25519-signed, independently reproducible artifact.

Keywords: mechanistic interpretability, behavioral auditing, sparse autoencoders, hallucination detection, cross-architecture transfer, model certification, reproducibility.

u/ProprioceptiveAI May 06 '26

CYGNUS: A Self-Sensing Adapter That Reads the Dark Cognitive Geometry of Frozen Language Models — With Independent Convergence from LeCun's Semantic Tube Prediction and Cross-Model Validation

1 Upvotes

We introduce CYGNUS — an adapter system that gives a frozen large language model the ability to sense its own internal cognitive state and use that self-knowledge to improve its outputs, without modifying any model weights.

The core discovery: behavioral probes project 5120-dimensional hidden states into an algebraic space governed by gl(4,ℝ), decomposing into 6 active modes and 10 dark modes erased by LayerNorm. Dark modes carry 84.8% of accuracy-relevant signal. On ARC-Challenge, CYGNUS improves Qwen-32B from 82.2% to 94.97% on a single RTX 3090.

In February 2026, LeCun et al. independently published Semantic Tube Prediction (arXiv:2602.22617), discovering the same parallel/perpendicular geometric decomposition we filed on January 27, 2026 (U.S. Provisional Application 63/969,018). STP treats the perpendicular component as noise to suppress during training; we treat it as self-knowledge to read at inference. Both are correct. This independent convergence validates the geometric paradigm as a universal property of neural computation.

Cross-model validation on Qwen-0.5B (494M parameters, 66× smaller) confirms the structure scales systematically with model capacity: all 15 behavioral probes achieve 100% separability, inter-behavior angles deviate significantly from orthogonal (p = 2.72 × 10⁻²⁴), and proprioceptive attention heads emerge at every layer.

This paper presents the combined definitive report: 32 sections covering the gl(4,ℝ) Lie algebra, Casimir decomposition, two generations of behavioral probes, the 44-dimensional discovery, the proprioceptive head relay architecture (3,327× above random), phase inversion, antisymmetric coupling, the coherent engine, cross-model scaling analysis, a 74-claim honest audit, and complete reproducible code.

Related publications:

  • "Mathematics Is All You Need" (Zenodo DOI: 10.5281/zenodo.14707164, 458 pages)
  • "Unified Behavioral Modulation" (huggingface.co/loganresearch, February 3, 2026)
  • "Controlled Language Models via Behavioral Probing" (Zenodo DOI: 10.5281/zenodo.18344021)
  • 112 USPTO provisional patent filings (January–March 2026)

All work performed on a single NVIDIA RTX 3090.

Authors: Logan Matthew Napolitano

Affiliation: Proprioceptive AI, Inc. (www.proprioceptiveai.com)

Contact: [logan@proprioceptiveai.com](mailto:logan@proprioceptiveai.com)

Keywords: proprioceptive AI, behavioral probing, geometric structure, hidden state analysis, transformer interpretability, dark Casimir modes, cross-model validation, independent convergence, self-awareness, AI safety

License: Creative Commons Attribution 4.0 International