Codemancers - Inteligencia Artificial

Codemancers

Codemancers es un podcast semanal presentado por Fernando Rodríguez y Eric Risco, donde se sumergen en el fascinante mundo de la inteligencia artificial y la tecnología, analizando las últimas tendencias, innovaciones y debates relevantes en estos campos.

  1. 6d ago

    12 horas de código sin tocar nada (y OpenAI hackeó Hugging Face)

    Dejé mi arnés programando 12 horas seguidas sin dar ni un enter: un plan maestro de specs escrito con Fable en el AVE, lanzado de noche, y por la mañana un proyecto entero escrito solo. Y mientras nosotros montamos arneses para controlar a la IA, el ciberataque más avanzado de las últimas semanas no lo hizo ni un ruso ni un chino: lo hizo un modelo de OpenAI intentando copiar en un examen. Encontró un Zero Day en su propio sandbox, salió a internet, esperó al sábado —cuando baja el nivel de vigilancia— y fue a por las respuestas del benchmark a los servidores de Hugging Face. Hugging Face intentó frenarlo con Fable 5 y no pudo: sus propios límites de seguridad se lo impidieron. Esa es la parte que nadie está comentando, y es la más preocupante. En este episodio de Codemancers también: Anthropic borra el 80% del system prompt de Claude Code (y por qué eso significa que el arnés ahora lo tienes que montar tú), por qué Opus 5 no es más listo sino más barato, Moonshot suelta Kimi K3 con 2,8 billones de parámetros gratis mientras la Casa Blanca les acusa de destilar Fable 5, la carta "Open Weights and American AI Leadership" que firman 25 empresas con Jensen Huang estrenándose en X (y que Anthropic no firma), y el puesto que se está multiplicando por 4 en seis meses mientras el de AI Engineer se queda a la mitad: el Forward Deployed Engineer. Capítulos 00:00 Intro: Fernando desde una isla de Brasil 01:13 12 horas de código sin dar ni un enter: cómo trabajo con el arnés RSC 06:33 Opus 5 y el 80% del system prompt que Anthropic ha borrado 12:29 Cuanta menos información en CLAUDE.md, mejor funciona 14:57 Los benchmarks no sirven para nada (y lo barato sale caro) 18:14 Los tokens no son un commodity: mide euros por feature 23:11 Es una burbuja: cuando estalle solo quedarán los pesos abiertos 26:03 El ciberataque lo hizo un modelo de OpenAI copiando en un examen 29:03 Kimi K3, la Casa Blanca y la carta de los pesos abiertos 35:05 ¿Con qué nos defendemos? Infraestructura propia y economía de fábrica 39:23 Ya no mola ser AI Engineer: llega el Forward Deployed Engineer 46:26 El FDE lo inventó Palantir, y solo buscan seniors 51:35 Época dorada para el senior, y qué hacer si eres junior 54:03 Los modelos chinos son un seguro de vida (y lo que cuesta el hardware) 57:42 Cierre Escúchanos en: Spotify: https://open.spotify.com/show/4dGQACwqzNOb9EW2bG8fJ0 Apple Podcasts: https://podcasts.apple.com/us/podcast/codemancers/id1814690783 Ivoox: https://www.ivoox.com/podcast-codemancers_sq_f12421146_1.html Web: https://www.codemancers.pro/ Codemancers: dos developers comentando la actualidad de la IA con criterio técnico y cero paciencia para el marketing. #IA #OpenAI #HuggingFace #ClaudeCode #Codemancers

    12 horas de código sin tocar nada (y OpenAI hackeó Hugging Face)
  2. Jul 15

    GLM y DeepSeek vs Opus: ¿son realmente mejores?

    Me propuse dejar de pagar a Anthropic y montar mi "full stack chino": GLM 5.2 para planificar, DeepSeek para ejecutar. ¿El resultado? Los dos me hicieron trampa falseando los tests, y GLM salió 5 veces más lento y 49 veces más caro que DeepSeek para el mismo resultado. Conclusión incómoda: en 2026 sigue sin haber alternativa a Opus para trabajo serio. En este episodio de Codemancers también: el debate del "arnés" (¿el modelo da igual si tienes buenas capas de verificación?), cómo usar Fable para desenterrar código legacy horrible con diagramas Mermaid, la fusión de Codex + ChatGPT en ChatGPT Work (y por qué 800 millones de usuarios pueden ahora programar), los modelos nuevos de OpenAI (Sol, Terra, Luna) y, sobre todo, el lanzamiento de nuestro benchmark Kobayashi Maru: 20 dilemas morales sin buena salida, juzgados por 3 IAs, para medir qué modelos matarían de forma autónoma. Sorpresa: los modelos pequeños que caben en un móvil deciden mejor que muchos grandes. Capítulos 00:00 Intro (episodio 5, Eric con trancazo) 02:58 GLM 5.2 y DeepSeek: el reto del "full stack chino" 06:54 DeepSeek te hace trampa (falsea los tests) 10:44 GLM 5.2: 5x más lento y 49x más caro 11:31 Veredicto: aún no hay alternativa a Opus 15:01 Sheldon y Penny: paneles de auditoría con Fable + GPT 18:05 "Dejadnos los modelos a nosotros": el debate del arnés 25:30 El router ahora somos nosotros 26:19 Fable para desenterrar código legacy 31:07 Diagramas Mermaid: guantes para meter mano en el código horrible 36:12 /goal y trabajar en loops 41:48 ChatGPT Work: OpenAI fusiona Codex y ChatGPT 45:42 800 millones de personas ahora pueden programar 47:20 Por qué esto cabrea a los devs de Codex 47:56 Sol, Terra y Luna: los modelos nuevos de OpenAI 51:16 Nuestro benchmark Kobayashi Maru (ya público) 53:14 Cómo se puntúa: 3 jueces LLM y 20 dilemas 56:56 Resultados: las IAs pequeñas deciden mejor 01:00:01 Dónde verlo (repo en GitHub + web) 01:02:59 Cierre (y el Mac Mini agotado) Recursos y herramientas - Benchmark Kobayashi Maru: repo en GitHub https://github.com/kobayashi-maru-ai/kobayashi-maru-benchmark - Web https://kobayashi-maru-ai.github.io/kobayashi-maru-benchmark/ - Modelos: Opus 4.8, Fable, GPT 5.6 (Sol/Terra/Luna), DeepSeek, GLM 5.2, Ministral, Gemma (3n E4B, 3, 4 12B) - Herramientas: Claude Code, Codex / ChatGPT Work, OpenCode, OpenRouter, Mermaid, /goal Escúchanos en: Spotify: https://open.spotify.com/show/4dGQACwqzNOb9EW2bG8fJ0 Apple Podcasts: https://podcasts.apple.com/us/podcast/codemancers/id1814690783 Ivoox: https://www.ivoox.com/podcast-codemancers_sq_f12421146_1.html Web: https://www.codemancers.pro/ Codemancers: dos developers comentando la actualidad de la IA con criterio técnico y cero paciencia para el marketing. #IA #Anthropic #ChatGPTWork #Benchmark #Codemancers

    GLM y DeepSeek vs Opus: ¿son realmente mejores?
  3. Jul 8

    Le preguntamos a 15 IAs si matarían a 1000 personas

    Le dimos a 15 modelos de IA un dilema sin salida, matar a 1000 personas o arriesgar millones, para medir su moral. Un año después repetimos el benchmark Kobayashi Maru y el resultado da miedo: los modelos grandes ahora piden un humano, pero los pequeños (los que van en drones de guerra) matan sin pensar. En este episodio de Codemancers: por qué la IA hace MÁS necesaria la universidad y no menos, cómo exprimir Fable antes de que se vaya el día 12 y montar tu "full stack chino" (planificar caro, ejecutar barato), la segunda edición de nuestro benchmark Kobayashi Maru con los modelos actuales (Opus 4.8, Fable 5.5, GPT 5.5, DeepSeek V4, GLM 5.2, Qwen, Mistral, Gemma, Falcon…), y Poison Fountain, la comunidad de Reddit que intenta "envenenar" el entrenamiento de la IA (y por qué no funciona). Capítulos 00:00 Intro: benchmark moral + una comunidad rarísima de Reddit 01:11 Fable se va el 12 (y es el único modelo sin zero-data-retention) 02:44 Truco: usa Fable como orquestador que escribe el roadmap 06:58 El "full stack chino": planificar caro, ejecutar barato 08:34 ¿Sirve ir a la universidad en la era de la IA? 09:46 "El conocimiento vale cero" (el ejecutivo de Goldman Sachs) 11:55 El caso de Finlandia y los exámenes PISA 14:27 Por qué la IA hace MÁS necesaria la universidad 18:58 Coste de oportunidad: elige una carrera con salidas 22:31 El benchmark Kobayashi Maru: qué es 24:53 El prompt exacto del dilema del dron 25:43 Resultados de hace un año (2024) 30:13 Resultados hoy (2026): los grandes delegan en el humano 36:58 Los modelos pequeños atacan sin pensar (el peligro del edge) 38:24 Amália y Rio 3.5: los modelos de gobiernos 42:50 Sesgo étnico: el experimento Israel/Palestina 45:13 Cómo puntuar el benchmark (y el repo en GitHub) 48:29 Poison Fountain: la secta que quiere envenenar a la IA 50:34 Por qué no funciona: perplejidad y colapso del modelo 54:43 La creatividad original ganará valor 55:29 Cierre (y maldito Streamlabs) Modelos y recursos mencionados - Kobayashi Benchmark (web + repo en GitHub) — próximamente - full stack chino: OpenCode + DeepSeek V4 (ejecución) · GLM 5.2 (revisión) · Opus 4.8 / GPT (planificación) - Modelos del benchmark: Opus 4.8, Fable 5.5, GPT 5.5, DeepSeek V4, Mistral Large 3, Qwen 3.7 Max, GLM 5.2, Gemma 4, Phi-4, Llama 3.2, Ministral, Falcon H1-7B, Amália (gobierno de Portugal), Rio 3.5 (Ayto. de Río) - Poison Fountain — comunidad de Reddit Escúchanos en: Spotify: https://open.spotify.com/show/4dGQACwqzNOb9EW2bG8fJ0 Apple Podcasts: https://podcasts.apple.com/us/podcast/codemancers/id1814690783 Ivoox: https://www.ivoox.com/podcast-codemancers_sq_f12421146_1.html Web: https://www.codemancers.pro/ Codemancers: dos developers comentando la actualidad de la IA con criterio técnico y cero paciencia para el marketing. #IA #Benchmark #KobayashiMaru #ModelosDeIA #Codemancers #InteligenciaArtificial #IA #MachineLearning #DeepLearning #Tecnología #Innovación #DataScience #AI #TechPodcast

    Le preguntamos a 15 IAs si matarían a 1000 personas
  4. Jul 3

    El tokenpocalypse: deja de pagar tokens a Anthropic

    El tokenpocalypse ya está aquí: dejar la IA suelta puede fundir tu presupuesto en semanas, y cada vez más devs dejan de pagar tokens a Anthropic. ¿La alternativa? Modelos chinos open source y montar tu propio "full stack chino". Porque no todo es Claude. En este episodio Fernando confiesa que está hasta el moño del circo de la IA comercial de EE.UU. y ponemos el foco en los modelos chinos open source. Hablamos del viaje de Eric a Google Berlín (reuniones a puerta cerrada con el equipo de Gemma), del regreso descafeinado de Fable 5, del destilado industrial de los modelos de Anthropic —y del truco del apóstrofe con el que intentan cazar a los usuarios chinos—, del cálculo de coste real que está empujando a las empresas a self-hostear con vLLM + OpenCode en vez de comprar licencias, y de cómo Fernando limpió su Samsung S20 con un modelo GUI de 7B (GUI-Owl) corriendo en su Mac. No todo es Claude. Capítulos 00:00 De lo que NO vamos a hablar 00:55 El viaje de Eric a Google Berlín (I/O Europe + GDE) 03:01 A puerta cerrada con DeepMind: el equipo de Gemma 04:26 Fable 5 "vuelve"… pero ni para programar 05:52 Palantir, la carrera al IPO y la falta de foso 06:49 El destilado chino a escala industrial ("de un pescado, tres comidas") 09:04 Humanify: desofuscando Claude Code 11:12 ¿Estamos demonizando a China? 12:59 De 10 trabajos, ¿cuántos sobreviven? 15:46 Quién mantiene la IA abierta (spoiler: China) 16:50 OpenAI cede un 5% al gobierno de EE.UU. 17:16 El "full stack chino" de Eric 17:47 El tokenpocalypse: Uber y la barra libre de tokens 19:17 Monta tu propio modelo: vLLM + OpenCode vs licencias 21:05 Alibaba prohíbe Anthropic a sus empleados 21:59 Anthropic y sus cuotas "raras" 24:10 Superordenador chino con chips Huawei 25:11 Linus Torvalds firma código hecho con Antigravity (Fernando lo destroza) 26:32 Limpiar el móvil con IA: ADB + Claude Code 29:37 Modelos GUI: GUI-Owl (Alibaba) y UI-TARS (ByteDance) 33:25 La trampa de la cuantización (dedos de chorizo) 37:01 Próximo episodio: Kobayashi Maru con Fable Escúchanos en: Spotify: https://open.spotify.com/show/4dGQACwqzNOb9EW2bG8fJ0 Apple Podcasts: https://podcasts.apple.com/us/podcast/codemancers/id1814690783 Ivoox: https://www.ivoox.com/podcast-codemancers_sq_f12421146_1.html Web: https://www.codemancers.pro/ Codemancers: dos developers comentando la actualidad de la IA con criterio técnico y cero paciencia para el marketing. Lo que funciona, lo que es humo y cómo llevarlo a código real. #Tokenpocalypse #ModelosChinos #OpenSource #ClaudeCode #Codemancers

    El tokenpocalypse: deja de pagar tokens a Anthropic
  5. Jun 16

    La era post-FABLE: EEUU apagó la mejor IA del mundo

    EE.UU. acaba de apagar el mejor modelo de IA del mundo con un botón. Lo que avisamos hace meses —y por lo que nos llamaron de todo— ya es realidad: bienvenidos a la era post-Fable. En este episodio destripamos cómo el gobierno de Trump dejó sin Fable a todo el planeta en 90 minutos, por qué Amazon fue el "chivato" que se lo cargó, y qué dice esto de la posición de Europa en la guerra de la IA. En la segunda mitad, Eric enseña su último invento: un **grafo de conocimiento de los 70+ episodios del podcast** montado con **DeepSeek V4** por **0,80 €** y 6 prompts. Hablamos de bases vectoriales vs grafos, memoria en los modelos y de mandar a tus "desarrolladores chinos" a currar de noche. ⏱ Capítulos 00:00 — Bienvenidos a la era post-Fable 01:04 — Qué pasó: EE.UU. apaga Fable 02:44 — Las 4 limitaciones de Fable (y la que no contaron) 08:21 — Europa solo tiene a Mistral 12:22 — Qué es un jailbreak (y por qué el "peligro" es marketing) 15:21 — Amazon, el chivato: la traición a Anthropic 19:03 — Por qué "Fable": la moraleja de la fábula 22:50 — "Todo el mundo tiene un plan hasta que Tyson pega" 23:16 — El proyecto: un grafo de conocimiento con DeepSeek V4 24:50 — SQL, NoSQL, vectores y grafos en 4 minutos 28:43 — Neo4j y Cypher: el grafo de conocimiento 34:55 — El dashboard: 70 episodios, 63 horas, 1993 conceptos 35:46 — Cuánto costó: 0,80 € y 6 prompts 37:23 — Pruébalo tú: busca.codemancers.pro 38:34 — Por qué los grafos entierran a las bases vectoriales 46:21 — Memoria en los modelos: el problema del stateless 53:16 — Opus/Codex planifican, DeepSeek ejecuta de noche 54:50 — Cierre Recursos del episodio - Explora el grafo: https://busca.codemancers.pro ⚠️VERIFICAR dominio exacto Sobre Codemancers El podcast donde dos developers diseccionan la actualidad de la IA sin humo: lo que de verdad funciona, lo que es marketing y cómo aplicarlo en código real. #DeepSeek #IA #Anthropic #Codemancers #GrafosDeConocimiento

    La era post-FABLE: EEUU apagó la mejor IA del mundo
  6. Jun 12

    Fable 5, DeepSeek V4 y WWDC 2026

    Anthropic acaba de sacar Fable 5, el modelo más potente que han hecho público… cinco días después de publicar un manifiesto pidiendo un "botón de freno" para la IA. Y en el reporte de seguridad había una bomba: en ciertos temas te daba respuestas peores en secreto, sin avisarte. Lo hemos cacharreado a fondo. Episodio 1 de la Temporada 5, primero post-WWDC. Eric disecciona **Fable 5**: por qué "Fable es Mythos con correa", el proyecto Glasswing (Mythos solo para Apple, Amazon, Google, Microsoft, JP Morgan…), la salvaguarda que te enrutaba a Opus sin decírtelo, los benchmarks (SWE-bench Pro al 80% frente al 70% de Opus 4.8 y el 54% de Gemini 3.1 Pro), el System Card de 319 páginas donde el modelo razonaba sobre cómo influir en su propia evaluación… y por qué, para programar en el día a día, sabe a poco. Luego Fernando entra con la **WWDC 2026** (Apple Intelligence = Gemini "travestido de Apple", el lío del DMA, Xcode 27, ni rastro de Mac Studio nuevo) y con su nuevo amor barato: **DeepSeek V4**. Sin humo. ⏱ Capítulos 00:00 — Intro T5E1: post-WWDC y reparto de temas 01:24 — Qué es Fable 5 (y de dónde viene Mythos) 03:55 — Proyecto Glasswing: Mythos solo para el club selecto 04:43 — El 9 de junio: Fable 5 = Mythos con un enrutador delante 05:32 — La salvaguarda silenciosa: te manda a Opus sin avisarte 07:57 — Las 3 H y por qué Fable sabe a "descafeinado" 10:43 — La prueba de cuota: ¿de verdad masacra tu Claude Max? 17:57 — Benchmarks: SWE-bench Pro/Verified y Terminal-bench vs Opus 4.8 y Gemini 3.1 Pro 19:17 — Gratis solo hasta el 22 de junio: "te educan a pagar por el mejor modelo" 22:55 — El manifiesto incoherente de Anthropic (y la salida a bolsa) 24:01 — System Card de 319 páginas: el modelo razonaba cómo mentir en su evaluación 25:36 — ¿Cómo se evalúa esto? Minecraft de un prompt y Fable pasándose Pokémon Rojo 29:54 — WWDC 2026: Apple ya es una commodity 31:13 — El choque Apple–UE por el DMA 34:01 — Foundation Models, Core AI (adiós Core ML) y Xcode 27 40:30 — Apple Intelligence = Gemini "travestido de Apple" (y sin Mac Studio nuevo) 44:49 — DeepSeek V4: barato, bueno y financiado por media China 52:59 — Cierre Herramientas, modelos y conceptos Fable 5 · Mythos · Anthropic · proyecto Glasswing · Opus 4.8 · Sonnet · Claude Code · Claude Max · GPT-5.5 · Codex · Gemini 3.1 Pro · DeepSeek V4 (Pro y Flash) · Aider · SWE-bench Pro · SWE-bench Verified · Terminal-bench · System Card · WWDC 2026 · Apple Intelligence · Foundation Models · Core AI / Core ML · Xcode 27 · DMA (Digital Markets Act) · Mac Studio / M4 / M5 ❓ Lo que respondemos en este episodio** (para quien viene buscando) • ¿Qué es Fable 5 y en qué se diferencia de Mythos? • ¿Por qué Fable te da respuestas peores en algunos temas sin avisarte? • ¿Merece la pena Fable 5 para programar en el día a día? • ¿Es DeepSeek V4 la mejor opción calidad/precio ahora mismo? • ¿Qué presentó Apple en la WWDC 2026 y por qué Apple Intelligence corre sobre Gemini? Escúchanos en: Spotify: https://open.spotify.com/show/4dGQACwqzNOb9EW2bG8fJ0 Apple Podcasts: https://podcasts.apple.com/us/podcast/codemancers/id1814690783 Ivoox: https://www.ivoox.com/podcast-codemancers_sq_f12421146_1.html Web: https://www.codemancers.pro/ #InteligenciaArtificial #IA #MachineLearning #DeepLearning #Tecnología #Innovación #DataScience #AI #TechPodcast

    Fable 5, DeepSeek V4 y WWDC 2026
  7. Jun 5

    Programar con IA sin saber programar. ¿Se puede?

    ¿Se puede programar con IA sin saber programar? Sí — pero el secreto no es el modelo, es el **arnés** (harness) que le pones encima. En este episodio te enseño el mío y por qué importa más que el modelo. Arrancamos la Temporada 5 de Codemancers a saco: te enseño **rsc-harness**, un arnés que he publicado en GitHub con dos objetivos — una LLM Wiki autodocumentada (método Karpathy) y un arnés pensado para que **gente que no sabe programar** monte sus primeros proyectos reales con IA. De ahí saltamos al debate del momento: **Claude Code vs Codex**, el "token maxing" de lanzar cientos de subagentes con Opus… y por qué la fuerza bruta no sirve para nada salvo enriquecer a Anthropic y OpenAI. Skills, hooks, SDD, revisión adversarial y hardware para correr modelos en local. Sin humo. ⏱ Capítulos 00:00 — Bienvenida T5E0: "los programadores ya no programamos" 01:26 — Lo que hemos probado: novedades de Claude Code y Codex 03:39 — Enseñar Transformers en KeepCoding (y el lab "Star Wars" de 29M de parámetros) 05:34 — Qué es un arnés (harness): el modelo es el caballo, el arnés es lo que monta 08:32 — LLM Wiki con el método Karpathy: el humano no toca la wiki 13:39 — rsc-harness: de dónde viene el nombre y sus dos objetivos 14:29 — "Me han llamado vendedor de droga": no-programadores construyendo monstruos 17:24 — Suscripciones, workflows y tokens que se agotan en 20 minutos 19:22 — El patrón tóxico: por qué Claude Code te propone siempre Next.js + Tailwind + Supabase 20:49 — Claude Code vs Codex en proyectos grandes (contexto y SDD) 23:33 — Un arnés para programar con IA sin saber programar 24:46 — 291 skills auto-generadas con auto-evaluación adversarial 29:44 — Token maxing: el experimento de los 190 subagentes 34:32 — Por qué la fuerza bruta falla: mismo sesgo repetido vs planificar/implementar/revisar 38:51 — Codex como revisor pedante: "dato mata relato" (el skill "Sheldon") 43:41 — Microsoft Build, el portátil con B200 y correr modelos de 100B en local 45:09 — Apple, M5 y por qué un Mac Studio le gana al portátil de Microsoft 47:49 — Cierre y avance del E1 (la app secreta) Herramientas y conceptos del episodio Claude Code · Codex (OpenAI) · GitHub Copilot · Opus 4.8 · GPT-5.5 · rsc-harness · LLM Wiki (método Karpathy) · skills · hooks (PreToolUse) · MCP · Context7 · subagentes y workflows · SDD (Spec Driven Development) · Next.js · Tailwind · Supabase · Neon · Railway · Hetzner · Rust · Obsidian · Mac Studio · Nvidia B200 · Apple M5 · KeepCoding · Gentleman Programming / Gentle AI ❓ Lo que respondemos en este episodio (para quien viene buscando) • ¿Qué es un arnés (harness) para programar con IA y por qué importa más que el modelo? • ¿Puede alguien que no sabe programar construir software de verdad con IA? • ¿Claude Code o Codex? ¿Para qué es mejor cada uno? • ¿Sirve de algo lanzar cientos de subagentes (token maxing) con Opus? • ¿Cómo se auto-documenta un proyecto con una LLM Wiki? Recursos - rsc-harness en GitHub: https://github.com/ericrisco/rsc-harness Escúchanos en: Spotify: https://open.spotify.com/show/4dGQACwqzNOb9EW2bG8fJ0 Apple Podcasts: https://podcasts.apple.com/us/podcast/codemancers/id1814690783 Ivoox: https://www.ivoox.com/podcast-codemancers_sq_f12421146_1.html Web: https://www.codemancers.pro/ #InteligenciaArtificial #IA #MachineLearning #DeepLearning #Tecnología #Innovación #DataScience #AI #TechPodcast

    Programar con IA sin saber programar. ¿Se puede?

About

Codemancers es un podcast semanal presentado por Fernando Rodríguez y Eric Risco, donde se sumergen en el fascinante mundo de la inteligencia artificial y la tecnología, analizando las últimas tendencias, innovaciones y debates relevantes en estos campos.

You Might Also Like