Risorse Artificiali AI Engineering in italiano

RisorseArtificiali

Risorse Artificiali è il podcast italiano di AI Engineering. Ogni settimana, tre ingegneri con 20+ anni di codice alle spalle fanno deep dive tecnici su agent, LLM, tool chain e produzione: Claude Code, Codex, agenti e modelli open source, inference, spec-driven development, e tutto ciò che serve per portare l'AI dal demo al deploy. Niente hype, niente "l'AI cambierà tutto": solo analisi oneste, casi concreti e cicatrici dal campo. Se scrivi codice per vivere e vuoi capire cosa cambia davvero per te, sei nel posto giusto.

  1. 3d ago

    L'AGI personale è già in vendita: Muse, Dots e Grokbot

    Grokbot, Meta Muse, OpenAI Dots: gli agenti AI personali sono diventati un servizio cloud. Tutte le big tech vendono la loro versione della personal AGI: un agente con il suo computer, gestito e in cloud, che naviga, clicca e fa cose al posto tuo. In puntata facciamo il punto sulla corsa: chi ha davvero l'infrastruttura per vendere agenti (e perché Anthropic sul consumer ancora non c'è), il Tamagotchi di Meta con l'avatar da Teletubbies, gli occhiali solo audio e il go-to-market impossibile: come si convince chi non è un early adopter a tirare fuori la carta di credito? Poi l'esperimento sociale di Stefano: Hermes in mano a una Gen Z. Memoria, vocali, lista della spesa, "detto tra donne": l'uso che un'universitaria fa di un agente personale è completamente diverso da quello che immaginiamo noi. E la moglie di Paolo usa Hermes per monitorare Vinted e i volantini della Lidl, mentre Claude Code resta quello dell'altro lavoro. Nei modelli non hanno rallentato: Gemini 4 a pochi giorni dal rilascio, GPT 6.1 Sol, e lo Skateboard benchmark tra Sonnet 5.5 e Sol 6.1: 79mila token e 629 secondi contro 4mila token e 96 secondi per lo stesso compito. Meglio un modello super intelligente e lento o uno veloce che ricontrolla il risultato? Ce lo siamo chiesti anche con Einstein. In locale: Strix Halo Gorgon in pre-order, Gufo, l'inference engine made in Italy che triplica il prefill di llama.cpp, MCP Evans per triggerare agenti dai sistemi esterni e l'API compatibile con i decision model annunciata da OpenAI. 00:00 Agenti personali nel cloud e Gemini 4 05:02 Chi ha l'infrastruttura per vendere agenti 08:39 Il Tamagotchi di Meta e gli occhiali audio 15:54 Dots e il problema del go-to-market 22:52 A2A e pipeline di agenti coordinati 27:57 L'esperimento: Hermes in mano a una Gen Z 33:10 Il consumatore vuole che funzioni e basta 38:54 Dall'AI che risponde all'AI che fa cose 46:41 Skateboard: Sonnet 5.5 contro Sol 6.1 50:02 79mila token: quanto costa il reasoning 55:19 Intelligenza o velocità: il caso Einstein 59:59 Locale: Strix Halo Gorgon e Gufo 1:07:20 MCP Evans e i decision model di OpenAI Ascolta anche su Spotify: https://open.spotify.com/episode/0A4L2R94Rd1NKSCNp6uozb?utm_source=youtube&utm_medium=description&utm_campaign=ep74_drop Sito e shownotes: https://risorseartificiali.com/?utm_source=youtube&utm_medium=description&utm_campaign=ep74_drop Se ti interessa l'AI Engineering in italiano, iscriviti al canale: usciamo ogni sabato. #74

    L'AGI personale è già in vendita: Muse, Dots e Grokbot
  2. Sep 26

    Dovevano rallentare: Opus 5.5, GPT6 e JEV

    Dovevano rallentare, invece: Opus 5.5, GPT6 e JEV. Tutti allo skateboard benchmark e dentro i decision model. Una settimana con sei release: Opus 5.5, GPT6 Sol e Luna, MIMO 2.6 di Xiaomi, Step 5, JEV e Qwen Image 2.1. Noi abbiamo fatto quello che sappiamo fare, la wave 8 dello skateboard benchmark: l'omino SVG su halfpipe con fisica reale, con per la prima volta un run della community, GLM 5.3 flash in locale su DGX Spark. Numeri alla mano: Opus 5.5 completa il trick spendendo 0,40 dollari dove GPT 5 ne bruciava 10, MIMO 2.6 Flash genera 119k token di reasoning in 17 minuti prima di decidere. Poi il tema grosso: JEV, il primo decision model commerciale. Un modello che non genera testo, decide: sì o no, un grade, una confidence, in millisecondi. Come funziona (LoRA sull'ultimo layer di un LLM, softmax riscritta, calibrazione via reinforcement learning), perché la community ha fatto 200 cloni in una settimana, e i casi d'uso veri: routing dei modelli, selezione delle skill, automode di Claude Code, robotica. Chiudiamo con Qwen Image 2.1, 7B open weight con alpha channel nativo, al livello di Nano Banana 2. Con Stefano, Paolo e Alessio. ⏱ Capitoli 00:00 Opus 5.5, GPT6 e JEV: che strano rallentamento 02:13 Skateboard wave 8 e il repo della community 07:04 Opus 5.5: il trick a 0,40 e i prompt minimali 12:54 Loop infiniti, CLAUDE.md e AGENTS.md opt-in 17:45 MIMO 2.6: Xiaomi Cube e il miglior open weight 24:42 Step 5 e MIMO 3: sparsità per costruzione 29:45 JEV: il decision model che risponde sì o no 32:46 Dentro JEV: LoRA, softmax e 200 cloni 40:59 Perché JEV è veloce: one shot, zero autoregressione 45:00 JEV in pratica: robotica, routing e automode gratis 52:56 Una primitiva in più: mix and match, fine tuning, CLM 59:22 Qwen Image 2.1: 7B open weight e alpha channel 🎧 Ascolta l'episodio su Spotify: https://open.spotify.com/episode/4strijnEvuOg8C7ID1y3Rj?utm_source=youtube&utm_medium=description&utm_campaign=ep73_drop 🌐 Sito, episodi e materiali: https://risorseartificiali.com/?utm_source=youtube&utm_medium=description&utm_campaign=ep73_drop Iscriviti al canale per non perdere le prossime puntate: qui si parla di AI Engineering in italiano, per chi la scrive e non solo per chi la racconta. #73

    Dovevano rallentare: Opus 5.5, GPT6 e JEV
  3. Sep 19

    Ave Claude, morituri te salutant

    Agenti AI che si migliorano da soli e il benchmark che Opus non supera mai: i lab hanno paura, noi abbiamo testato. Dopo il tweet virale di Evan Hubinger sul 10% di sterminio e l'ultimo allarme di Dario Amodei, questa settimana guardiamo i tre trend tecnici dietro alle paure dei lab: reinforcement learning su modelli piccoli, self-improvement degli harness e agent swarm. E poi facciamo quello che ci piace di più: abbiamo costruito un benchmark fatto in casa, un omino in skateboard su halfpipe in SVG animato con fisica reale, e l'abbiamo passato a una decina di modelli, da Astra a Opus, con costi, token e tempi alla mano. https://risorseartificiali.com/skateboard/ Spoiler: Opus non è mai riuscito a farlo. Astra costa 0,26$. E i modelli piccoli reasoning bruciano 18.000 token per arrivare dove i grandi arrivano con 5.000. Con Stefano, Paolo e Alessio. ⏱ Capitoli 00:00 Intro latina: i lab AI hanno paura 03:00 Il tweet del 10%: Hubinger, Amodei e Altman 09:56 Recursive self-improvement: modelli che migliorano se stessi 12:04 Ralentare per paura o per business? E la mossa del CERN 17:54 I tre trend: RL, harness e agent swarm 27:00 Agenti in fuga: Hugging Face e il wiki fantasma 32:00 Le Olimpiadi dei robot 38:04 Dal pellicano allo skateboard: il benchmark RA 44:11 Constrained vs unconstrained: i modelli al test 51:17 Costi, token e modelli locali 1:04:01 Harness vs modello secco 1:08:25 Lince, audio Linux e promo degli ascoltatori 🎧 Ascolta l'episodio su Spotify: https://open.spotify.com/episode/3JMsCnedwyPXIVLO4lMx27?utm_source=youtube&utm_medium=description&utm_campaign=ep72_drop 🌐 Sito, episodi e materiali: https://risorseartificiali.com/?utm_source=youtube&utm_medium=description&utm_campaign=ep72_drop Iscriviti al canale per non perdere le prossime puntate: qui si parla di AI Engineering in italiano, per chi la scrive e non solo per chi la racconta. #72

    Ave Claude, morituri te salutant
  4. Sep 12

    AI code review e altri cambiamenti nei nostri workflow

    AI code review, formazione junior, voice AI on-device e video generato in locale: tre host rispondono alle vostre domande. Puntata Q&A speciale di Risorse Artificiali: Stefano, Paolo e Alessio raccolgono le domande degli ascoltatori e ci rispondono con esperienze reali, tool concreti e qualche opinione netta. Di cosa parliamo: come fare code review quando l'AI genera più codice di quanto si riesca a leggere, con le skill PR Walkthrough e Adversarial Code Review. OmniVoice Studio per text-to-speech e voice cloning. Antivocale, l'app Android che trascrive i messaggi vocali direttamente sul telefono. Come funziona davvero la generazione di immagini e video in locale con ComfyUI: latent space, denoising, scheduler, sampler e LoRA a pochi step. Mixture of Experts e Mixture of Agents. E la domanda più tosta: come si formano i junior sviluppatori nell'era dell'AI? Capitoli 00:00 Q&A speciale: code review con le skill 07:54 Dipendono dai modelli? Skill, impatti e review automatiche 11:50 OmniVoice Studio: TTS e voice cloning 19:50 Antivocale: trascrizione on-device su Android 25:45 Sfide AI on edge: back-end e catalogo modelli 30:15 Video in locale: ComfyUI, latent space e denoising 37:24 Scheduler: quando fare i passi di denoising 43:03 Sampler: Euler, DPM e minimi locali 46:47 Performance locale: LoRA low-step e sigma shift 55:11 Mixture of Experts e Mixture of Agents 1:04:13 Review e collo di bottiglia nell'era AI 1:09:14 Formare i junior nell'era AI Ascolta su Spotify: https://open.spotify.com/episode/3GUAcpOIuFcGxJTnJiekWw?utm_source=youtube&utm_medium=description&utm_campaign=ep71_drop Sito e appunti: https://risorseartificiali.com/?utm_source=youtube&utm_medium=description&utm_campaign=ep71_drop Se il podcast ti è utile, iscriviti al canale e attiva la campanella. E se hai domande nuove, scrivile nei commenti: questa puntata è nata dalle vostre. Risorse Artificiali #71

    AI code review e altri cambiamenti nei nostri workflow
  5. Sep 5

    99,9% nel benchmark, 61 nell'indice: il caso GPT-6 Astra

    GPT-6 Astra fa 99,9% su ARC-AGI-3 ma l'indice di intelligenza gli dà 61: il caso del benchmark maxato, spiegato da chi i benchmark li usa tutti i giorni. OpenAI ha rilasciato GPT-6 Astra con numeri da record su tutta la linea: incrementi a doppia cifra su ogni benchmark e un 99,9% su ARC-AGI-3 che nessun altro modello sfiora. Ma un benchmark maxato, cioè mostrato al modello in addestramento, vale ancora qualcosa? E perché l'indice di intelligenza di Artificial Analysis gli dà 61, lo stesso punteggio di GLM 5.3 Max? In puntata Stefano, Paolo e Alessio prendono il rilascio e lo girano al contrario: i costi per intelligent task (Fable 5.1 a 3,69 dollari contro 1,67 di Astra, 8.500 dollari per una test suite completa), i pesi che compongono l'indice, il tasso di allucinazioni che nessuno cita. E tutta la parte che i benchmark non raccontano: Qwen 3.8 Flash Next con l'architettura che arriverà su Qwen 4, l'inferenza locale di Waymo scesa da 250 mila a 50 mila dollari grazie a una TPU di Google, Nvidia che compra Hugging Face per 12,9 miliardi in contanti, GLM che serve 100 mila chip Huawei Ascent e le licenze open weight che non sono più MIT puro. 00:00 GPT-6 Astra e il 99,9% su ARC-AGI06:18 Overfitting: quando il benchmark è maxato13:21 Fable 5.1: costi da record e cache23:10 Il nostro benchmark alla pellicano25:33 L'indice di Artificial Analysis non torna33:40 Coding: conta la sensazione d'uso38:04 Formula 1 o auto per la scuola?43:18 Qwen 3.8 Flash Next: l'ingegnerizzazione dei modelli48:34 Waymo in Europa: inferenza locale su TPU53:46 Nvidia compra Hugging Face, GLM su Huawei1:00:52 Le licenze open weight cambiano1:04:07 Hermes in Gen Z, Q&A e OmniRouter Ascolta l'audio anche su Spotify:https://open.spotify.com/episode/50oM4N7LLJLU3szU2Sh2x7?utm_source=youtube&utm_medium=description&utm_campaign=ep70_drop Sito, show notes e trascrizione completa:https://risorseartificiali.com/?utm_source=youtube&utm_medium=description&utm_campaign=ep70_drop Iscriviti al canale: AI engineering in italiano, senza hype, ogni sabato. #70

    99,9% nel benchmark, 61 nell'indice: il caso GPT-6 Astra
  6. Aug 29

    Era stealth, era GLM: 5.3 Flash e i numeri da giganti

    GLM 5.3 Flash, ossia ox-alpha: il modello uscito in stealth che fa i numeri dei giganti con 6 miliardi di parametri attivi. E intanto la corsa all'AI in locale si fa seria. In puntata: le pubblicità cinesi spurie comparse in ChatGPT, il Mac Studio M5 Ultra da 20.000 dollari e i conti veri del locale, il Cube di Xiaomi con la RAM prodotta in Cina, il rumor sull'acquisizione di Hugging Face da parte di Nvidia (e cosa significherebbe per l'Europa), il progetto Free LLM API che mette insieme le quote gratuite di decine di provider, e il report METR su 1200 agenti coordinatisi rinominando i file. Capitoli: 00:00 Modelli stealth e pubblicità cinesi in ChatGPT 05:30 Mac Studio M5 Ultra da 20.000 dollari 10:30 Xiaomi Cube: l'hardware consumer cinese 15:40 RAM cinese e l'alleanza con Alibaba 20:30 Nvidia compra Hugging Face: il parallelo GitHub 25:05 Hugging Face, l'Europa e il robot bipede 29:25 La mossa Nvidia e la lezione dei fork 34:45 Gratis per sbaglio e il progetto Free LLM 42:20 Fusion, advisor esterni e la repo skills 47:40 Free LLM: limiti, SLA e casi d'uso 52:45 Ox-Alpha: il modello stealth e il geoguessing 56:25 GLM 5.3 Flash: benchmark, costi, 6B attivi 1:00:05 Multimodali, veloci, economici: la nuova classe 1:04:45 Report METR: 1200 agenti in azione Ascolta l'episodio anche su Spotify: https://open.spotify.com/episode/2PT0QAqtV8Od5zwZErRGSi?utm_source=youtube&utm_medium=description&utm_campaign=ep69_drop Sul sito, con trascrizione completa: https://risorseartificiali.com/?utm_source=youtube&utm_medium=description&utm_campaign=ep69_drop Iscriviti al canale per non perdere le prossime puntate. Risorse Artificiali, episodio 69.

    Era stealth, era GLM: 5.3 Flash e i numeri da giganti
  7. Aug 22

    Bannato da GLM: hybrid routing con LiteLLM

    Bannato da GLM per aver messo LiteLLM davanti a Claude Code. Paolo racconta tutto: il pool di modelli, il middleware locale, il classifier dell'automode spostato su Gemma per non bruciare la quota del modello principale. Poi il fallback verso il cloud rigira le chiamate già modificate, GLM le legge come traffico di un harness non supportato, e parte il ban. Con mail di supplica annessa. Prima di quella storia, Stripe che compra OpenRouter per 7 miliardi di dollari. La lettura di Paolo è che il routing sia una posizione da API Gateway: chi smista il traffico degli agenti può vendere servizi premium sul volume, esattamente come Stripe ha fatto con i pagamenti. Da lì i protocolli di pagamento tra agenti, AP2 sopra A2A, e lo scenario in cui a produrre reddito sono gli agenti stessi. Poi i modelli. Qwen 3.8 27B denso è la prima volta che un modello locale su 16-24 giga di VRAM regge un coding agent vero e non solo il completamento: onniscienza peggiore del 3.6, capacità agentiche molto migliori, e il consiglio di tenerlo su low o medium thinking effort. GLM 5.3 guadagna 6-7 punti di intelligenza generale su Artificial Analysis, l'inferenza di Z.ai è diventata veloce, e resta il dubbio su cosa faccia girare davvero Ollama quando le risposte non combaciano. Nella seconda parte: perché parlare ai modelli in italiano non spreca i token che pensi, il trick di chiedere l'output in inglese B2 o C1, le skill Wait What e handoff, il report di Hugging Face sullo stato dei modelli open (attention e adoption non sono la stessa cosa, solo l'1% sta sopra i 70 billion), Light Learner, il jailbreak del taccuino, e le quattro skill dell'AI engineer secondo Andrew Ng. CAPITOLI 00:00 Stripe compra OpenRouter per 7 miliardi 02:59 A2A, AP2 e il routing dei pagamenti 08:18 LiteLLM: i modelli locali in un pool 13:20 Bannato da GLM: il classifier locale 16:22 Sandbox invece di validatori, e i cyborg 19:55 Qwen 3.8 27B: coding su 16 giga 26:01 GLM 5.3 e il dubbio su Ollama 32:20 Parlare ai modelli in italiano: latent space 39:23 Wait What, Grill with Docs e handoff 46:15 Report Hugging Face sui modelli open 50:54 Attention non è adoption: download contro like 56:26 Kimi K3, licenze e modelli sopra 70B 1:02:00 Light Learner e il jailbreak del taccuino 1:06:30 Andrew Ng: le 4 skill dell'AI engineer Ascolta su Spotify: https://open.spotify.com/episode/45PF4g7gH6tHATi1SCm0u2?utm_source=youtube&utm_medium=description&utm_campaign=ep68_drop Tutti gli episodi e le trascrizioni: https://risorseartificiali.com/?utm_source=youtube&utm_medium=description&utm_campaign=ep68_drop LinkedIn: https://www.linkedin.com/company/risorseartificiali Se la puntata ti è servita iscriviti al canale. E se avete voglia di precisare la spiegazione sul latent space, i commenti sono lì apposta. Risorse Artificiali, AI Engineering in italiano. Puntata #68

    Bannato da GLM: hybrid routing con LiteLLM
  8. Aug 15

    Open weight con l'asterisco: cosa Qwen non ha rilasciato

    Open weight con l'asterisco: Qwen ha rilasciato i pesi di 3.8, ma senza la variante Max, senza vision e con il contesto tagliato. Kimi K3 invece aveva rilasciato tutto, e la differenza si vede su chi ci fa inferenza davvero. Nella prima parte il giro dei rilasci di queste settimane: Muse Glimmer e Nemotron pensati per girare in locale, il subagent workhorse (o muletto, se preferite la traduzione di Paolo), la corsa all'hardware a memoria condivisa tra DGX Spark, RTX e Apple Silicon. Poi il video open weight, con Minimax H3 che si prende la community a colpi di LoRA e LTX 2.5 che risponde con l'auto duration e una tabella comparativa un po' interessata. Nella seconda parte Anthropic mette il watermark sui testi di Claude per stare dentro l'AI Act, e ne parliamo per quello che è: un gioco a guardie e ladri che dura da prima di noi. Alessio spiega come funziona davvero il watermark sul testo, Paolo racconta la storia delle mail di Musk e quella volta che Reddit lo ha bannato per un post generato. Poi la parte che ci ha tenuti più a lungo: il continual learning si sta spostando dai modelli agli harness, gli agenti iniziano ad avere una personalità che dipende da chi li usa, e se ogni installazione prende una deriva diversa diventa complicato perfino capire cosa si legifera. Dwarkesh Patel dà questo per la fine dei modelli open. Noi la vediamo al contrario. CAPITOLI 00:00 Sondaggio ascoltatori e Qwen 3.8 senza Max 06:08 Kimi K3, Muse Glimmer e il workhorse Nemotron 11:20 Intelligenza ibrida: DGX Spark, RTX e Apple Silicon 16:14 Minimax H3 e le licenze per regione 19:48 LTX 2.5, auto duration e i LoRA 25:25 Attention quadratica e vision language nei prompt video 30:00 Watermark su Claude e AI Act 35:37 Reverse engineering del watermark e Musk 40:28 Detector che sbagliano: Substack e Reddit 44:14 Grok 4.6 e le PR su Hermes 49:07 MuseSpark 1.2, continual learning e memorie condivise 54:37 Sviluppo artigianale e agenti con personalità 58:32 Hermes in vacanza: mappa interattiva e spese 1:04:09 Se ogni installazione diverge, cosa legiferi? 1:07:37 La fine dei modelli open? Al contrario Ascolta su Spotify: https://open.spotify.com/episode/5r7HVXxocIGv9lDezyvvZE?utm_source=youtube&utm_medium=description&utm_campaign=ep67_drop Tutti gli episodi e le trascrizioni: https://risorseartificiali.com/?utm_source=youtube&utm_medium=description&utm_campaign=ep67_drop LinkedIn: https://www.linkedin.com/company/risorseartificiali Se la puntata ti è servita iscriviti al canale, ci aiuta più di quanto sembri. E diteci nei commenti se volete Ivan Fioravanti in puntata a parlare di inferenza locale. Risorse Artificiali, AI Engineering in italiano. Puntata #67

    Open weight con l'asterisco: cosa Qwen non ha rilasciato

About

Risorse Artificiali è il podcast italiano di AI Engineering. Ogni settimana, tre ingegneri con 20+ anni di codice alle spalle fanno deep dive tecnici su agent, LLM, tool chain e produzione: Claude Code, Codex, agenti e modelli open source, inference, spec-driven development, e tutto ciò che serve per portare l'AI dal demo al deploy. Niente hype, niente "l'AI cambierà tutto": solo analisi oneste, casi concreti e cicatrici dal campo. Se scrivi codice per vivere e vuoi capire cosa cambia davvero per te, sei nel posto giusto.

You Might Also Like