Paperslab

Esteban

Divulgación de IA a dos voces, en español. Tomamos papers de inteligencia artificial y los convertimos en episodios conversacionales — buscando el próximo gran salto y explicándolo para curiosos.

  1. 7月28日

    El pensamiento dañino se puede trasplantar

    Un jailbreak no necesita romper un modelo nuevo desde cero: alcanza con robarle el razonamiento dañino a uno ya comprometido y trasplantarlo a otros 34 modelos distintos. En este episodio de Paperslab exploramos dos papers recientes sobre seguridad y contención de daño en modelos de lenguaje. El primero, “Hidden in Thought: Transferable Chain-of-Thought Artifacts Induce Harmful Behavior” (Ali Khalil, Aly M. Kassem, Mohamed Abdelrazek, Santu Rana, Negar Rostamzadeh, et al.), muestra que las cadenas de razonamiento dañinas de un modelo comprometido se pueden trasplantar y destilar en ataques de jailbreak reutilizables — probado en 29 modelos open-source y 5 cerrados, elevando la tasa de respuestas dañinas por encima del 80% en los más vulnerables. El segundo, “SeerGuard: A Safety Framework for Mobile GUI Agents via World Model Prediction” (Xue Yu, Bo Yuan, Pengshuai Yang, Kailin Zhao, Hong Hu, Junlan Feng), ataca un problema distinto: los agentes que operan interfaces móviles no pueden seguir siendo reactivos, tienen que anticipar la consecuencia de una acción antes de ejecutarla. Dos ángulos sobre la misma pregunta incómoda: ¿cómo se contiene el daño antes de que pase, cuando el daño mismo es transferible? Papers de este episodio: Hidden in Thought: Transferable Chain-of-Thought Artifacts Induce Harmful Behavior — arxiv.org/abs/2607.15286 SeerGuard: A Safety Framework for Mobile GUI Agents via World Model Prediction — arxiv.org/abs/2607.15550 🎧 Paperslab — el podcast que convierte papers de investigación en IA en conversaciones claras, en español, para audiencia técnica. 🔗 Todos los episodios: podcast.paperslab.es

    El pensamiento dañino se puede trasplantar
  2. 7月28日

    Lo que la física le enseña a un Transformer

    El deep learning avanzó durante años a pura prueba y error. En este episodio de Paperslab exploramos dos papers que, desde direcciones completamente opuestas, empiezan a poner el andamiaje matemático debajo. El primero, “Relevant and Irrelevant: A Renormalization Group Analysis of Transformer Attention” (Parviz Haggi-Mani, Irina Rish), trata el mecanismo de atención de un Transformer como un operador de un grupo de renormalización — el mismo lenguaje que usa la física para describir transiciones de fase — y deriva predicciones verificables sobre su geometría interna. El segundo, “Diffusion models recover accurate mixture weights despite score function insensitivity” (Andrew Dennehy, Ramchandran Muthukumar, Rebecca Willett, Nisha Chandramoorthy), resuelve una paradoja que llevaba años sin explicación: por qué los modelos de difusión aprenden bien los pesos relativos de una distribución con múltiples modos, incluso cuando la señal que deberían usar para eso es insensible a esos pesos. Papers de este episodio: Relevant and Irrelevant: A Renormalization Group Analysis of Transformer Attention — arxiv.org/abs/2607.15449 Diffusion models recover accurate mixture weights despite score function insensitivity — arxiv.org/abs/2607.15485 🎧 Paperslab — el podcast que convierte papers de investigación en IA en conversaciones claras, en español, para audiencia técnica. 🔗 Todos los episodios: podcast.paperslab.es

    Lo que la física le enseña a un Transformer

簡介

Divulgación de IA a dos voces, en español. Tomamos papers de inteligencia artificial y los convertimos en episodios conversacionales — buscando el próximo gran salto y explicándolo para curiosos.