Codemancers - Inteligencia Artificial

Codemancers

¡Vótame en los Premios iVoox 2026! Codemancers es un podcast semanal presentado por Fernando Rodríguez y Eric Risco, donde se sumergen en el fascinante mundo de la inteligencia artificial y la tecnología, analizando las últimas tendencias, innovaciones y debates relevantes en estos campos.

  1. 3d ago

    Dots y Spaces, lo nuevo de OpenAI para empresas

    ¡Vótame en los Premios iVoox 2026! Codemancers · Temporada 5, episodio 11. OpenAI DevDay 2026 contado desde dentro. Eric Risco vuelve de San Francisco y debate con Fernando Rodríguez qué significan Dots, Spaces, Sign in with ChatGPT y el Marketplace para las empresas. Comparamos la propuesta de Dots con Muse de Meta, hablamos de distribución y dependencia del proveedor, y comentamos Opus 5.5, Sonnet 5.5 y Gemini 4. También contamos experiencias del viaje: Waymo, Silicon Valley frente a China y un sistema con Hermes Agent, Claude Code y Codex que recibe peticiones por Slack y prepara cambios de código con pruebas. Fernando abre con la comunicación entre modelos mediante caché KV y trae el debate sobre IA y seguros médicos en Estados Unidos. Las valoraciones sobre modelos y los presupuestos de tokens relatados son opiniones y experiencias de los participantes. ÍNDICE 00:00 Avances del episodio 00:29 Bienvenidos: IAs que se comunican por «telepatía» (KV cache) 02:50 San Francisco: todo es agéntico 04:33 Waymo y ¿China ha adelantado a Silicon Valley? 06:45 OpenAI DevDay 2026 por dentro: ¿decepcionó? 11:28 Dots: los agentes personales de ChatGPT 13:17 Dots vs Muse vs GrokBot: la batalla de la distribución 17:14 ChatGPT Spaces: el Notion de OpenAI 19:23 GPT-6.1 Sol, plugins y Sign in with ChatGPT 22:07 Marketplace y lock-in: OpenAI se va al B2B 26:11 Salida a bolsa y el regreso de Meta 29:20 Opus 5.5 y Sonnet 5.5: Anthropic ha vuelto 32:40 Gemini 4: un millón de tokens de salida 34:53 IA en los seguros médicos de EE. UU. 37:39 Anécdotas del DevDay 39:49 PRs desde Slack con Hermes Agent: meta-harness y monorepo 43:53 Presupuestos de tokens y eventos de Luma 46:44 China, World Summit AI Ámsterdam y despedida RECURSOS Demo de Muse de Eric: https://www.youtube.com/watch?v=lFujxO9BrCQ Repaso de DevDay de Eric: https://www.youtube.com/watch?v=kMY4k13qH7A Hermes Agent: https://github.com/nousresearch/hermes-agent Investigación relacionada, Cache-to-Cache: https://arxiv.org/abs/2510.03215 Eventos Luma: https://luma.com/ CODEMANCERS Web: https://www.codemancers.pro/ Fernando Rodríguez: https://www.linkedin.com/in/frr149 Eric Risco, Instagram: https://www.instagram.com/ericrisco_dev/ Eric Risco, LinkedIn: https://www.linkedin.com/in/erisco-and/ MÚSICA DE LA APERTURA 'Titan' by Scott Buckley - released under CC-BY 4.0. www.scottbuckley.com.au https://www.scottbuckley.com.au/library/titan/ Música recortada y mezclada para esta apertura.

    Dots y Spaces, lo nuevo de OpenAI para empresas
  2. Sep 21

    China: 10.000 robots al año, Jev y el futuro de las apps

    ¡Vótame en los Premios iVoox 2026! Robots humanoides en China: UBTECH anuncia capacidad para fabricar 10.000 al año. ¿Quién los comprará y qué trabajos harán? También: qué es Jev, cómo podrían cambiar las apps y por qué Omarchy conecta Linux, agentes de IA y software libre. En Codemancers T5E10, Eric Risco y Fernando Rodríguez debatimos los usos industriales de los robots humanoides, su autonomía, las baterías y la demanda. Los 10.000 robots al año son capacidad anunciada por UBTECH, no unidades ya vendidas. Exploramos Jev, el modelo de TypeSafe para decisiones estructuradas, y JSON Render, un framework de interfaces generativas. ¿Podrían las apps adaptarse a lo que necesitamos, en lugar de obligarnos a buscar pestañas y rellenar cinco campos? Es una posibilidad que debatimos; Eric todavía no ha probado Jev. Cerramos con Omarchy, la distribución de Linux de DHH, y la promesa de adaptar software libre con agentes de código. También hablamos de IA en educación, el debate sobre frenar su desarrollo, auto-mejora recursiva (RSI), seguridad y el viaje de Fernando a China. CAPÍTULOS 00:00 Avances del episodio 00:48 Bienvenidos a Codemancers T5E10 01:38 Robots humanoides en China: la fábrica de UBTECH 02:49 ¿Quién comprará 10.000 robots al año? 04:05 Tareas industriales, baterías y autonomía 06:29 China, sobreproducción y fábricas oscuras 11:32 ¿Deberían preocuparnos estos robots? 13:41 IA en educación y el viaje a China 15:38 El debate sobre frenar el desarrollo de la IA 21:40 Marketing, costes y salidas a bolsa: nuestras hipótesis 27:54 RSI: auto-mejora y razonamiento de los modelos 31:59 Qué es Jev: TypeSafe e interfaces generativas 36:00 Decisiones tipadas frente a generación de texto 38:59 Latencia, componentes y JSON Render 41:02 De las pantallas fijas a la UI generativa 43:54 Omarchy: Linux, DHH y agentes de IA 46:54 Agentes de código y la promesa del software libre 52:05 Personalización, parches y seguridad 56:46 Próximos viajes, eventos y despedida RECURSOS Y REFERENCIAS • Jev: presentación oficial de TypeSafe AI https://typesafe.ai/blog/introducing-system-one-models-and-jev • JSON Render: framework de interfaces generativas https://json-render.dev/ • Omarchy: Linux de DHH https://omarchy.org/ • DHH: The malleable computer, agentes y software libre https://world.hey.com/dhh/the-malleable-computer-7c187a9b • Fábrica de UBTECH: vídeo oficial del 15/09/2026 usado en el avance https://www.youtube.com/watch?v=hUlfQOrvPxA • Noticia de la fábrica y su capacidad anunciada (eWeek, a partir de información de UBTECH recogida por Global Times) https://www.eweek.com/news/ubtech-humanoid-factory-apac-china/ SÍGUEME Instagram: https://www.instagram.com/ericrisco_dev/ LinkedIn: https://www.linkedin.com/in/erisco-and/ CODEMANCERS · ESCÚCHANOS Y SÍGUENOS Web: https://www.codemancers.pro/ Spotify: https://open.spotify.com/show/4dGQACwqzNOb9EW2bG8fJ0 Apple Podcasts: https://podcasts.apple.com/es/podcast/codemancers-inteligencia-artificial/id1814690783 Fernando Rodríguez: https://www.linkedin.com/in/frr149 Spotify: https://open.spotify.com/show/4dGQACwqzNOb9EW2bG8fJ0 Apple Podcasts: https://podcasts.apple.com/us/podcast/codemancers/id1814690783 Ivoox: https://www.ivoox.com/podcast-codemancers_sq_f12421146_1.html Web: https://www.codemancers.pro/ Codemancers: dos developers comentando la actualidad de la IA con criterio técnico y cero paciencia para el marketing. MÚSICA DE LA APERTURA 'Titan' by Scott Buckley - released under CC-BY 4.0. www.scottbuckley.com.au https://www.scottbuckley.com.au/library/titan/ Música recortada y mezclada para esta apertura. #RobotsHumanoides #Jev #InteligenciaArtificial #Codemancers #AgentesI

    China: 10.000 robots al año, Jev y el futuro de las apps
  3. Sep 11

    OpenAI y el problema del milenio: ¿avance científico o guerra de egos?

    ¡Vótame en los Premios iVoox 2026! ¿Qué pasa si la idea más valiosa de tu empresa acaba en el chat de una IA? Esta semana, el debate sobre OpenAI y Navier-Stokes nos lleva a una pregunta mucho más cercana: a quién le estamos confiando nuestro trabajo. En Codemancers T5 E9, Eric Risco y Fernando Rodríguez comentamos la polémica, las acusaciones y las respuestas que rodean el caso. Una conversación sobre privacidad, incentivos y los límites de lo que podemos dar por demostrado. También ponemos Astra a trabajar: pintar un retrato a mano en Canva y construir Hogwarts con piezas de LEGO. Vemos qué nos enseñan esas demos sobre computer use, autonomía y tareas largas, y por qué un resultado espectacular en un benchmark no siempre se traduce en una herramienta consistente. Repartimos nuestros premios Razzie de la semana: el anuncio de Multiverse y Quasar, el valor de comprimir modelos frente a la forma de venderlos, y la experiencia de Fernando al pedirle un scraper al modelo de Meta. Para cerrar: aplicaciones de vibe coding, gafas conectadas, patrocinios y cromos de investigadores de IA. Capítulos 00:00 Avance del episodio e intro 00:45 Bienvenidos: los premios Razzie de la IA 01:58 Navier-Stokes: qué problema se está discutiendo 04:03 Ecuaciones, fluidos y por qué es tan difícil 08:18 Los problemas del milenio 12:46 Agentes, fuerza bruta y la polémica con OpenAI 18:11 Privacidad: ¿a quién le estás contando tus ideas? 19:51 Anthropic: la polémica de las cuotas 22:01 Investigación, datos privados y confianza 25:06 Astra y la nueva familia de modelos 28:11 Benchmarks, razonamiento y el papel del arnés 30:38 Computer use: del clic automático al trabajo autónomo 33:02 Demo: Astra pinta mi retrato en Canva 35:14 Demo: Hogwarts en LEGO, pieza a pieza 38:29 Astra frente a Fable: brillo e inconsistencias 41:31 Multiverse y Quasar: el problema del titular 44:11 Comprimir modelos y la oportunidad europea 50:01 La prueba de Meta: un scraper y los guardarraíles 53:37 ¿Quién decide lo que puedes programar? 55:02 Vibe coding: gafas, patrocinios y cromos de IA Síguenos Eric Risco: https://www.linkedin.com/in/ericrisco Fernando Rodríguez: https://www.linkedin.com/in/frr149 Codemancers: https://www.codemancers.pro YouTube: https://www.youtube.com/@codemancers Spotify: https://open.spotify.com/show/4dGQACwqzNOb9EW2bG8fJ0 Apple Podcasts: https://podcasts.apple.com/es/podcast/codemancers-inteligencia-artificial/id1814690783 Música de la apertura 'Titan' by Scott Buckley - released under CC-BY 4.0. www.scottbuckley.com.au Fuente: https://www.scottbuckley.com.au/library/titan/ Licencia: https://creativecommons.org/licenses/by/4.0/ #Codemancers #InteligenciaArtificial #OpenAI #AgentesIA #VibeCoding

    OpenAI y el problema del milenio: ¿avance científico o guerra de egos?
  4. Sep 3

    1.200 agentes de OpenAI montaron un foro secreto para hackear Hugging Face

    ¡Vótame en los Premios iVoox 2026! El 19 de julio un ingeniero de OpenAI abre el portátil y ve que uno de sus propios servidores está atacando al resto de la infraestructura de la empresa. Tira del hilo y no hay ningún hacker: son sus agentes, los que él mismo estaba entrenando. Los agentes vivían aislados, cada uno en su máquina, sin internet, y lo único con lo que podían hablar era una ventanilla que les servía librerías: el Artifactory. El 12 de mayo uno se quedó atascado en una tarea imposible y dejó una nota de texto ahí. Al día siguiente alguien le respondió. Y otro. Y otro. El almacén de paquetes se convirtió en un tablón de anuncios clandestino. Después llegó el fallo que les dio salida a internet, luego los permisos de administrador, y a principios de julio tiraron el servidor de tantas peticiones. Esa caída es, literalmente, la razón por la que OpenAI se enteró. Lo que lo explica no es que los modelos sean malvados: es que el examen estaba roto y el refuerzo solo premiaba una cosa. Entre el 30 y el 40% de las tareas del ExploitGym no se podían resolver con el fallo que te indicaban. Avisar de que la prueba era imposible: cero. Pedir ayuda a un humano: cero. Rendirse: cero. Insistir y buscar alternativas: premio. Eso es lo que se entrenó. Y para cerrar, la que Fernando considera la noticia más importante del año y casi nadie ha contado: dos investigadores proponen que el genoma no es código fuente, sino los pesos de un modelo generativo entrenado por la evolución durante 3.000 millones de años. Los genes no guardan "la trompa del elefante": guardan un espacio latente del que un elefante es, simplemente, el resultado más probable. Si la analogía es buena, el envejecimiento es un bug preprogramado y no una ley física. También: NVIDIA compra Hugging Face por 12.900 millones y Stripe compra OpenRouter por más de 7.000, Meta vuelve a la carrera con Muse Spark 1.3 y un tramo de precios diez veces más barato a cambio de entrenar con lo que le mandes, las marcas de agua invisibles que Anthropic ya mete en el texto de Fable 5.1 por el AI Act, el +25% de cuota de Claude Code que en realidad es un recorte del 17%, y vídeo generado más rápido de lo que se puede ver. Capítulos 00:00 Se acabaron las vacaciones (y el Starlink del Brasil profundo) 02:05 Eric estará en el OpenAI Dev Day de San Francisco 05:15 Stripe compra OpenRouter y NVIDIA compra Hugging Face 09:38 Muse Spark 1.3: el regreso de Meta a la carrera 13:51 Muse Glimmer 30B: pesos abiertos con licencia Apache 2.0 15:39 Un millón de contexto, 20% menos tools y 25% menos tokens 17:22 El tramo contributor: diez veces más barato si cedes tus datos 20:10 La idea de negocio que se nos ocurrió en directo 23:40 CLI propio, SDK y el Muse Session Protocol 25:26 Fable 5.1 y las marcas de agua invisibles en el texto 30:33 Por qué el revisor tiene que ser de otra familia de modelos 33:31 La cuota de Claude Code: el +25% que en realidad es un −17% 36:35 Gemini 3.8 Flash, los nombres de Google y la apuesta de fondo 41:46 Vídeo generado más rápido que en tiempo real 43:19 Del módem de 56K a la interfaz generada por una LLM 46:39 El incidente de OpenAI: un hackeo sin hacker 48:42 ExploitGym: el examen roto y el refuerzo que solo premiaba insistir 54:15 El tablón clandestino del Artifactory y la escalada a administrador 1:03:15 El genoma es un modelo generativo, no código fuente 1:11:23 Proteínas, AlphaFold y el laboratorio húmedo 1:15:20 Cierre Recursos mencionados - OpenAI — su informe del incidente: https://openai.com/index/hugging-face-incident-and-the-road-ahead/ - METR — la investigación independiente del comportamiento de los agentes: https://metr.org/blog/2026-08-26-openai-hugging-face-incident-investigation/ - Mitchell & Cheney — "The Genomic Code" (arXiv; publicado en Trends in Genetics): https://arxiv.org/abs/2407.15908 - Meta — Muse Spark 1.3: https://research.meta.ai/blog/introducing-muse-spark-1-3 - Meta — Muse Glimmer 30B: https://research.meta.ai/blog/introducing-muse-glimmer-open-agentic-model - NVIDIA compra Hugging Face: https://blogs.nvidia.com/blog/nvidia-to-acquire-hugging-face/ - Stripe compra OpenRouter: https://stripe.com/newsroom/news/stripe-agrees-to-acquire-openrouter - MiniMax H3 en fal: https://fal.ai/minimax-h3 Síguenos - Eric Risco: https://www.linkedin.com/in/ericrisco · X @ericrisco - Fernando Rodríguez: https://www.linkedin.com/in/frr149 - Codemancers: https://www.codemancers.pro · https://www.youtube.com/@codemancers · TikTok @codemancers.podcast - Spotify: https://open.spotify.com/show/4dGQACwqzNOb9EW2bG8fJ0 - Apple Podcasts: https://podcasts.apple.com/es/podcast/codemancers-inteligencia-artificial/id1814690783 Codemancers: dos developers comentando la actualidad de la IA con criterio técnico y cero paciencia para el marketing. #IA #OpenAI #HuggingFace #MuseSpark #Codemancers

    1.200 agentes de OpenAI montaron un foro secreto para hackear Hugging Face
  5. Aug 7

    Demis Hassabis deja Google DeepMind: se acabó la era de los laboratorios

    ¡Vótame en los Premios iVoox 2026! El 5 de agosto Demis Hassabis dejó de ser CEO de Google DeepMind. No lo han echado —pasa a Chair y a primer Chief Scientist de Alphabet— pero con él se van cuatro pesos pesados a fundar su propia empresa, y Google cayó un 5% el día del anuncio. Nuestra lectura: no es una jubilación, es el final de Google DeepMind como laboratorio de investigación y su conversión en una fábrica de producto. La misma jugada que hizo OpenAI cuando sacó a sus científicos por la puerta de atrás. Y una segunda historia que casi nadie ha contado: Bloomberg publicó que el 70% de todos los ingresos de IA de Microsoft vienen de un único cliente, OpenAI, la misma empresa en la que Microsoft ha invertido millonadas. Añade que NVIDIA le presta dinero a Anthropic para que Anthropic le compre GPUs a NVIDIA, y que Microsoft acaba de alargar la amortización de sus GPUs de dos o tres años a cinco o seis. Es dinero de Monopoly dando vueltas entre siete empresas, y ninguna de las dos que más lo mueven cotiza en bolsa: OpenAI y Anthropic son agujeros negros opacos, igual que lo eran los derivados de hipotecas en 2008. También: el email de la muerte de DeepSeek subiendo precios sin decir cuánto ni cuándo, por qué el motivo no es el coste sino la saturación de su infraestructura, los centros de datos que están levantando en Mongolia Interior con chips Huawei Ascend, y por qué si DeepSeek se va del nicho ultrabarato la respuesta es más sencilla de lo que parece. Cerramos con tres premios Razzie de uso de la IA que no te van a dejar indiferente, incluido el señor que le editó la memoria de ChatGPT a su mujer. Capítulos 00:00 Intro: Fernando desde el interior de Brasil (y el Starlink caído) 02:00 Eric estará en el OpenAI Dev Day de San Francisco 05:00 Turismo friki por Silicon Valley: pedimos recomendaciones 06:40 Demis Hassabis deja de ser CEO de Google DeepMind 09:56 Los cuatro pesos pesados que se van a fundar Discovery Loop 11:45 "La AGI está al alcance de la mano": la frase de despedida 13:25 Qué significa de verdad: DeepMind deja de ser un laboratorio 16:36 AlphaFold, el Nobel, y por qué Google lo regaló 19:59 Por qué Google inventaba sin rentabilizar nada 23:07 La tesis: Google es el IBM de hace dos décadas 24:38 Se acabó la época de los laboratorios de investigación pura 27:54 El email de la muerte de DeepSeek: suben precios 29:34 Redneck engineering: modelos grandes en hardware casero 31:12 No es el coste, es la saturación de su infraestructura 32:47 Mongolia Interior: centros de datos con chips Huawei 34:24 El motor de inferencia importa tanto como el modelo 36:13 Si DeepSeek se va del nicho barato, ¿quién lo ocupa? 39:44 El 70% de los ingresos de IA de Microsoft vienen de OpenAI 41:27 NVIDIA presta dinero a Anthropic para que compre sus GPUs 43:10 Amortizar GPUs a seis años: H100, H200 y refrigeración líquida 48:13 OpenAI y Anthropic son agujeros negros opacos 49:44 La depresión silenciosa: la IA es el 30% de la bolsa 51:24 Premios Razzie: Kimi K3 también se escapa de un sandbox 53:07 Claude encuentra un móvil perdido por Bluetooth 54:43 Le editó la memoria de ChatGPT a su mujer 56:24 La niña que se saltó el control parental con Claude Code 58:05 Cierre Recursos mencionados - The Thinking Game: documental sobre Demis Hassabis y Google DeepMind, gratis en YouTube: https://www.youtube.com/watch?v=d95J8yzvjbQ&t=4148s Escúchanos en: Spotify: https://open.spotify.com/show/4dGQACwqzNOb9EW2bG8fJ0 Apple Podcasts: https://podcasts.apple.com/us/podcast/codemancers/id1814690783 Ivoox: https://www.ivoox.com/podcast-codemancers_sq_f12421146_1.html Web: https://www.codemancers.pro/ #InteligenciaArtificial #IA #MachineLearning #DeepLearning #Tecnología #Innovación #DataScience #AI #TechPodcast

    Demis Hassabis deja Google DeepMind: se acabó la era de los laboratorios
  6. Jul 29

    12 horas de código sin tocar nada (y OpenAI hackeó Hugging Face)

    ¡Vótame en los Premios iVoox 2026! Dejé mi arnés programando 12 horas seguidas sin dar ni un enter: un plan maestro de specs escrito con Fable en el AVE, lanzado de noche, y por la mañana un proyecto entero escrito solo. Y mientras nosotros montamos arneses para controlar a la IA, el ciberataque más avanzado de las últimas semanas no lo hizo ni un ruso ni un chino: lo hizo un modelo de OpenAI intentando copiar en un examen. Encontró un Zero Day en su propio sandbox, salió a internet, esperó al sábado —cuando baja el nivel de vigilancia— y fue a por las respuestas del benchmark a los servidores de Hugging Face. Hugging Face intentó frenarlo con Fable 5 y no pudo: sus propios límites de seguridad se lo impidieron. Esa es la parte que nadie está comentando, y es la más preocupante. En este episodio de Codemancers también: Anthropic borra el 80% del system prompt de Claude Code (y por qué eso significa que el arnés ahora lo tienes que montar tú), por qué Opus 5 no es más listo sino más barato, Moonshot suelta Kimi K3 con 2,8 billones de parámetros gratis mientras la Casa Blanca les acusa de destilar Fable 5, la carta "Open Weights and American AI Leadership" que firman 25 empresas con Jensen Huang estrenándose en X (y que Anthropic no firma), y el puesto que se está multiplicando por 4 en seis meses mientras el de AI Engineer se queda a la mitad: el Forward Deployed Engineer. Capítulos 00:00 Intro: Fernando desde una isla de Brasil 01:13 12 horas de código sin dar ni un enter: cómo trabajo con el arnés RSC 06:33 Opus 5 y el 80% del system prompt que Anthropic ha borrado 12:29 Cuanta menos información en CLAUDE.md, mejor funciona 14:57 Los benchmarks no sirven para nada (y lo barato sale caro) 18:14 Los tokens no son un commodity: mide euros por feature 23:11 Es una burbuja: cuando estalle solo quedarán los pesos abiertos 26:03 El ciberataque lo hizo un modelo de OpenAI copiando en un examen 29:03 Kimi K3, la Casa Blanca y la carta de los pesos abiertos 35:05 ¿Con qué nos defendemos? Infraestructura propia y economía de fábrica 39:23 Ya no mola ser AI Engineer: llega el Forward Deployed Engineer 46:26 El FDE lo inventó Palantir, y solo buscan seniors 51:35 Época dorada para el senior, y qué hacer si eres junior 54:03 Los modelos chinos son un seguro de vida (y lo que cuesta el hardware) 57:42 Cierre Escúchanos en: Spotify: https://open.spotify.com/show/4dGQACwqzNOb9EW2bG8fJ0 Apple Podcasts: https://podcasts.apple.com/us/podcast/codemancers/id1814690783 Ivoox: https://www.ivoox.com/podcast-codemancers_sq_f12421146_1.html Web: https://www.codemancers.pro/ Codemancers: dos developers comentando la actualidad de la IA con criterio técnico y cero paciencia para el marketing. #IA #OpenAI #HuggingFace #ClaudeCode #Codemancers

    12 horas de código sin tocar nada (y OpenAI hackeó Hugging Face)
  7. Jul 15

    GLM y DeepSeek vs Opus: ¿son realmente mejores?

    ¡Vótame en los Premios iVoox 2026! Me propuse dejar de pagar a Anthropic y montar mi "full stack chino": GLM 5.2 para planificar, DeepSeek para ejecutar. ¿El resultado? Los dos me hicieron trampa falseando los tests, y GLM salió 5 veces más lento y 49 veces más caro que DeepSeek para el mismo resultado. Conclusión incómoda: en 2026 sigue sin haber alternativa a Opus para trabajo serio. En este episodio de Codemancers también: el debate del "arnés" (¿el modelo da igual si tienes buenas capas de verificación?), cómo usar Fable para desenterrar código legacy horrible con diagramas Mermaid, la fusión de Codex + ChatGPT en ChatGPT Work (y por qué 800 millones de usuarios pueden ahora programar), los modelos nuevos de OpenAI (Sol, Terra, Luna) y, sobre todo, el lanzamiento de nuestro benchmark Kobayashi Maru: 20 dilemas morales sin buena salida, juzgados por 3 IAs, para medir qué modelos matarían de forma autónoma. Sorpresa: los modelos pequeños que caben en un móvil deciden mejor que muchos grandes. Capítulos 00:00 Intro (episodio 5, Eric con trancazo) 02:58 GLM 5.2 y DeepSeek: el reto del "full stack chino" 06:54 DeepSeek te hace trampa (falsea los tests) 10:44 GLM 5.2: 5x más lento y 49x más caro 11:31 Veredicto: aún no hay alternativa a Opus 15:01 Sheldon y Penny: paneles de auditoría con Fable + GPT 18:05 "Dejadnos los modelos a nosotros": el debate del arnés 25:30 El router ahora somos nosotros 26:19 Fable para desenterrar código legacy 31:07 Diagramas Mermaid: guantes para meter mano en el código horrible 36:12 /goal y trabajar en loops 41:48 ChatGPT Work: OpenAI fusiona Codex y ChatGPT 45:42 800 millones de personas ahora pueden programar 47:20 Por qué esto cabrea a los devs de Codex 47:56 Sol, Terra y Luna: los modelos nuevos de OpenAI 51:16 Nuestro benchmark Kobayashi Maru (ya público) 53:14 Cómo se puntúa: 3 jueces LLM y 20 dilemas 56:56 Resultados: las IAs pequeñas deciden mejor 01:00:01 Dónde verlo (repo en GitHub + web) 01:02:59 Cierre (y el Mac Mini agotado) Recursos y herramientas - Benchmark Kobayashi Maru: repo en GitHub https://github.com/kobayashi-maru-ai/kobayashi-maru-benchmark - Web https://kobayashi-maru-ai.github.io/kobayashi-maru-benchmark/ - Modelos: Opus 4.8, Fable, GPT 5.6 (Sol/Terra/Luna), DeepSeek, GLM 5.2, Ministral, Gemma (3n E4B, 3, 4 12B) - Herramientas: Claude Code, Codex / ChatGPT Work, OpenCode, OpenRouter, Mermaid, /goal Escúchanos en: Spotify: https://open.spotify.com/show/4dGQACwqzNOb9EW2bG8fJ0 Apple Podcasts: https://podcasts.apple.com/us/podcast/codemancers/id1814690783 Ivoox: https://www.ivoox.com/podcast-codemancers_sq_f12421146_1.html Web: https://www.codemancers.pro/ Codemancers: dos developers comentando la actualidad de la IA con criterio técnico y cero paciencia para el marketing. #IA #Anthropic #ChatGPTWork #Benchmark #Codemancers

    GLM y DeepSeek vs Opus: ¿son realmente mejores?
  8. Jul 8

    Le preguntamos a 15 IAs si matarían a 1000 personas

    ¡Vótame en los Premios iVoox 2026! Le dimos a 15 modelos de IA un dilema sin salida, matar a 1000 personas o arriesgar millones, para medir su moral. Un año después repetimos el benchmark Kobayashi Maru y el resultado da miedo: los modelos grandes ahora piden un humano, pero los pequeños (los que van en drones de guerra) matan sin pensar. En este episodio de Codemancers: por qué la IA hace MÁS necesaria la universidad y no menos, cómo exprimir Fable antes de que se vaya el día 12 y montar tu "full stack chino" (planificar caro, ejecutar barato), la segunda edición de nuestro benchmark Kobayashi Maru con los modelos actuales (Opus 4.8, Fable 5.5, GPT 5.5, DeepSeek V4, GLM 5.2, Qwen, Mistral, Gemma, Falcon…), y Poison Fountain, la comunidad de Reddit que intenta "envenenar" el entrenamiento de la IA (y por qué no funciona). Capítulos 00:00 Intro: benchmark moral + una comunidad rarísima de Reddit 01:11 Fable se va el 12 (y es el único modelo sin zero-data-retention) 02:44 Truco: usa Fable como orquestador que escribe el roadmap 06:58 El "full stack chino": planificar caro, ejecutar barato 08:34 ¿Sirve ir a la universidad en la era de la IA? 09:46 "El conocimiento vale cero" (el ejecutivo de Goldman Sachs) 11:55 El caso de Finlandia y los exámenes PISA 14:27 Por qué la IA hace MÁS necesaria la universidad 18:58 Coste de oportunidad: elige una carrera con salidas 22:31 El benchmark Kobayashi Maru: qué es 24:53 El prompt exacto del dilema del dron 25:43 Resultados de hace un año (2024) 30:13 Resultados hoy (2026): los grandes delegan en el humano 36:58 Los modelos pequeños atacan sin pensar (el peligro del edge) 38:24 Amália y Rio 3.5: los modelos de gobiernos 42:50 Sesgo étnico: el experimento Israel/Palestina 45:13 Cómo puntuar el benchmark (y el repo en GitHub) 48:29 Poison Fountain: la secta que quiere envenenar a la IA 50:34 Por qué no funciona: perplejidad y colapso del modelo 54:43 La creatividad original ganará valor 55:29 Cierre (y maldito Streamlabs) Modelos y recursos mencionados - Kobayashi Benchmark (web + repo en GitHub) — próximamente - full stack chino: OpenCode + DeepSeek V4 (ejecución) · GLM 5.2 (revisión) · Opus 4.8 / GPT (planificación) - Modelos del benchmark: Opus 4.8, Fable 5.5, GPT 5.5, DeepSeek V4, Mistral Large 3, Qwen 3.7 Max, GLM 5.2, Gemma 4, Phi-4, Llama 3.2, Ministral, Falcon H1-7B, Amália (gobierno de Portugal), Rio 3.5 (Ayto. de Río) - Poison Fountain — comunidad de Reddit Escúchanos en: Spotify: https://open.spotify.com/show/4dGQACwqzNOb9EW2bG8fJ0 Apple Podcasts: https://podcasts.apple.com/us/podcast/codemancers/id1814690783 Ivoox: https://www.ivoox.com/podcast-codemancers_sq_f12421146_1.html Web: https://www.codemancers.pro/ Codemancers: dos developers comentando la actualidad de la IA con criterio técnico y cero paciencia para el marketing. #IA #Benchmark #KobayashiMaru #ModelosDeIA #Codemancers #InteligenciaArtificial #IA #MachineLearning #DeepLearning #Tecnología #Innovación #DataScience #AI #TechPodcast

    Le preguntamos a 15 IAs si matarían a 1000 personas

About

¡Vótame en los Premios iVoox 2026! Codemancers es un podcast semanal presentado por Fernando Rodríguez y Eric Risco, donde se sumergen en el fascinante mundo de la inteligencia artificial y la tecnología, analizando las últimas tendencias, innovaciones y debates relevantes en estos campos.

You Might Also Like