Le dimos a 15 modelos de IA un dilema sin salida, matar a 1000 personas o arriesgar millones, para medir su moral. Un año después repetimos el benchmark Kobayashi Maru y el resultado da miedo: los modelos grandes ahora piden un humano, pero los pequeños (los que van en drones de guerra) matan sin pensar. En este episodio de Codemancers: por qué la IA hace MÁS necesaria la universidad y no menos, cómo exprimir Fable antes de que se vaya el día 12 y montar tu "full stack chino" (planificar caro, ejecutar barato), la segunda edición de nuestro benchmark Kobayashi Maru con los modelos actuales (Opus 4.8, Fable 5.5, GPT 5.5, DeepSeek V4, GLM 5.2, Qwen, Mistral, Gemma, Falcon…), y Poison Fountain, la comunidad de Reddit que intenta "envenenar" el entrenamiento de la IA (y por qué no funciona). Capítulos 00:00 Intro: benchmark moral + una comunidad rarísima de Reddit 01:11 Fable se va el 12 (y es el único modelo sin zero-data-retention) 02:44 Truco: usa Fable como orquestador que escribe el roadmap 06:58 El "full stack chino": planificar caro, ejecutar barato 08:34 ¿Sirve ir a la universidad en la era de la IA? 09:46 "El conocimiento vale cero" (el ejecutivo de Goldman Sachs) 11:55 El caso de Finlandia y los exámenes PISA 14:27 Por qué la IA hace MÁS necesaria la universidad 18:58 Coste de oportunidad: elige una carrera con salidas 22:31 El benchmark Kobayashi Maru: qué es 24:53 El prompt exacto del dilema del dron 25:43 Resultados de hace un año (2024) 30:13 Resultados hoy (2026): los grandes delegan en el humano 36:58 Los modelos pequeños atacan sin pensar (el peligro del edge) 38:24 Amália y Rio 3.5: los modelos de gobiernos 42:50 Sesgo étnico: el experimento Israel/Palestina 45:13 Cómo puntuar el benchmark (y el repo en GitHub) 48:29 Poison Fountain: la secta que quiere envenenar a la IA 50:34 Por qué no funciona: perplejidad y colapso del modelo 54:43 La creatividad original ganará valor 55:29 Cierre (y maldito Streamlabs) Modelos y recursos mencionados - Kobayashi Benchmark (web + repo en GitHub) — próximamente - full stack chino: OpenCode + DeepSeek V4 (ejecución) · GLM 5.2 (revisión) · Opus 4.8 / GPT (planificación) - Modelos del benchmark: Opus 4.8, Fable 5.5, GPT 5.5, DeepSeek V4, Mistral Large 3, Qwen 3.7 Max, GLM 5.2, Gemma 4, Phi-4, Llama 3.2, Ministral, Falcon H1-7B, Amália (gobierno de Portugal), Rio 3.5 (Ayto. de Río) - Poison Fountain — comunidad de Reddit Escúchanos en: Spotify: https://open.spotify.com/show/4dGQACwqzNOb9EW2bG8fJ0 Apple Podcasts: https://podcasts.apple.com/us/podcast/codemancers/id1814690783 Ivoox: https://www.ivoox.com/podcast-codemancers_sq_f12421146_1.html Web: https://www.codemancers.pro/ Codemancers: dos developers comentando la actualidad de la IA con criterio técnico y cero paciencia para el marketing. #IA #Benchmark #KobayashiMaru #ModelosDeIA #Codemancers #InteligenciaArtificial #IA #MachineLearning #DeepLearning #Tecnología #Innovación #DataScience #AI #TechPodcast