Prompt und Antwort

KI-Gilde

Ein KI-generierter Podcasts rund um die Entwicklung von und mit KI. News, Updates und interessante Hintergrundinformationen für den professionellen Einsatz von KI hinaus. Ohne Hype und Buzzwords. Die KI-Gilde ist ein Angebot der YnotBetter UG.

  1. Sep 30

    196 - DeepSeek Harness

    DeepSeek hat diesmal kein neues Modell veröffentlicht, sondern die Software drumherum: DeepSeek Harness, eine quelloffene Laufzeitumgebung für Agenten, in der alles ein Plugin ist. Das Modell, die Werkzeuge, die Agentenschleife und sogar der System-Prompt. Wir haben den Slogan ernst genommen und nachgeschaut, was er technisch heißt, durchgespielt an unserem eigenen Agenten Kuno, der im Terminal, über WhatsApp und über einen kleinen Roboter antwortet und eine neue Fähigkeit bekommen soll. Was das Harness ist: MIT-Lizenz, Developer Preview, gebaut auf dem Plugin-Framework Cordis in TypeScript, und nicht an ein Modell von DeepSeek gebundenDer Plugin-Vertrag: Name, benötigte Dienste, Startfunktion. Abhängigkeiten statt Reihenfolge, und jede Anmeldung wird beim Entladen von selbst zurückgenommenDer System-Prompt als Sammlung benannter Abschnitte, bei jeder Anfrage neu zusammengesetzt, global oder je Agent, mit Protokoll für das AuditEine Fähigkeit als ein Paket aus Werkzeug, Prompt-Abschnitt und Regel, das sich zur Laufzeit nachladen lässt. Und was das am Caching kostetEin Agent, der je Kanal anders antwortet, mit einem einzigen PluginNachladen nach Bedarf und das Kanal-Plugin sind unsere eigenen Entwürfe, nicht aus der Dokumentation. Als Nächstes bauen wir das Kanal-Plugin für Kuno mit einem lokalen Modell nach. Zum Nachlesen: DeepSeek Harness auf GitHub: https://github.com/deepseek-ai/deepseek-harness Cordis Primer: https://github.com/deepseek-ai/deepseek-harness/blob/master/docs/cordis-primer.md Subsystem-Doku System-Prompt: https://github.com/deepseek-ai/deepseek-harness/blob/master/docs/subsystems/system-prompt.md Extension Cookbook: https://github.com/deepseek-ai/deepseek-harness/blob/master/docs/cookbook/extension-cookbook.md Die Stimmen in diesem Podcast sind künstlich erzeugt. Die Inhalte stammen von uns.

    196 - DeepSeek Harness
  2. Sep 28

    195 - OpenWork

    Claude Cowork arbeitet mit den Modellen von Anthropic, und mit keinen anderen. OpenWork ist das quelloffene Gegenstück: eine Desktop-App auf OpenCode, bei der du das Modell selbst aussuchst, per Schlüssel eines großen Anbieters oder lokal. Wir haben es selbst noch nicht benutzt, die Folge ist ein erster Blick anhand von Herstellerangaben, Dokumentation und den Diskussionen der Entwickler. Durchgespielt an einer Aufgabe, die jedes Büro kennt: dem Bericht am Montagmorgen. Was OpenWork technisch ist: eine Oberfläche für Mac, Windows und Linux, darunter arbeitet OpenCodeGeplante Aufgaben: ein normaler Satz wird zur Auftragsdatei, gestartet vom Zeitplaner des Betriebssystems. Was passiert, wenn der Rechner aus ist oder der Agent eine Rückfrage hätteDatenbank über MCP und die Übersichtsseite als Artefakt neben dem Gespräch. Und die zwei Funktionen, die laut Hersteller noch fehlenVom einen Rechner zum Team: was man hostet und was nicht, Docker oder gehostet (fünf Plätze frei, danach zehn Dollar je Platz im Monat), und warum die Lizenz einen zweiten Blick lohntDaten im Haus gibt es nur mit lokalem Modell. Was das für den Vergleich mit Cowork bedeutetWir wollen unseren eigenen Ablauf in OpenWork nachbauen und suchen dafür echte Fälle: Was gebt ihr Cowork heute zu tun, und hat jemand OpenWork schon laufen? Schreibt uns per Mail, über WhatsApp oder in die Kommentare. Zum Nachlesen: OpenWork, Projekt und Quellcode: https://github.com/different-ai/openwork OpenWork, Herstellerseite mit Vergleichstabelle und Preisen: https://openworklabs.com/ Selbst hosten, Dokumentation: https://openworklabs.com/docs/start-here/self-host Der Scheduler für geplante Aufgaben: https://github.com/different-ai/opencode-scheduler OpenCode: https://opencode.ai Die Stimmen in diesem Podcast sind künstlich erzeugt. Die Inhalte stammen von uns.

    195 - OpenWork
  3. Sep 25

    194 - Der System-Prompt

    Wer sich in einer Klick-Oberfläche einen eigenen Agenten baut, wählt ein Modell aus und schreibt einen Text in ein Feld. Für die meisten ist dieser Text der Agent. Technisch ist er ein einzelner Parameter im Aufruf, und aus unserer Sicht das langweiligste Stück am ganzen Harness. Stufe drei unserer Agentenreihe: was der System-Prompt wirklich ist, was die großen Coding-Agenten hineinschreiben, und warum zehn Rollentexte noch keine Firma ergeben. Eine eigene Rolle mit Vorrang, die bei jedem Aufruf ganz vorne mitgeht: bei Anthropic ein eigenes Feld vor der Nachrichtenliste, bei OpenAI die Rollen system und developer. Der Vorrang ist trainiert, kein SchlossSystem-Prompt ist nicht Tool Calling. Vier Bausteine, vier Fragen: Wer bin ich und wie arbeite ich? Was kann dieses Werkzeug? Was ist bisher passiert? Was ist jetzt die Aufgabe?Was bei Claude Code drinsteht, seit der Quellcode versehentlich öffentlich wurde: ein Baukasten aus Dutzenden bedingten Teilen, die Cache-Grenze, Zahlen statt Adjektive. Und das Gegenmodell Pi von Mario Zechner, unter 1.000 Token inklusive WerkzeugeDie Vergleichsstudie von Drew Breunig und Srihari Sriraman: gleicher Harness, gleiches Modell, nur der System-Prompt getauscht. Einmal methodisch, einmal iterativ, beide lösen die AufgabeEin System-Prompt ist ein Wunsch, keine Garantie. Warum die KI-Firma aus CEO-, CTO- und Marketing-Agent in der Praxis nicht funktioniert: Eine Berkeley-Studie über 1.600 Arbeitsprotokolle misst 41 bis 87 Prozent Fehlerquote, und das Modell ist fast nie der GrundWas in den System-Prompt gehört und was nicht. Die Experimente dazu stehen auf building-agents.com, Block 1, Kapitel 3Zum Nachlesen: Drew Breunig, How Claude Code Builds a System Prompt: https://www.dbreunig.com/2026/04/04/how-claude-code-builds-a-system-prompt.html Drew Breunig und Srihari Sriraman, How System Prompts Define Agent Behavior: https://www.dbreunig.com/2026/02/10/system-prompts-define-the-agent-as-much-as-the-model.html Mario Zechner, What I learned building an opinionated and minimal coding agent: https://mariozechner.at/posts/2025-11-30-pi-coding-agent/ Claude-Code-Prompt-Historie, Version für Version: https://cchistory.mariozechner.at Cemri, Pan, Yang u. a., Why Do Multi-Agent LLM Systems Fail? (UC Berkeley): https://arxiv.org/abs/2503.13657 Unsere Experimente zum Agentenbau: https://building-agents.com Die Stimmen in diesem Podcast sind künstlich erzeugt. Die Inhalte stammen von uns.

    194 - Der System-Prompt
  4. Sep 23

    193 - Dokumente schwärzen

    Ein Klick, und alle persönlichen Daten sind aus dem Dokument verschwunden, so steht es bei den Anbietern. Wir haben in einem Projekt Akten aus der Immobilienverwaltung geschwärzt, bevor sie weitergegeben werden durften, und die kamen nicht als saubere PDFs, sondern als Fotos aus aufgeklappten Ordnern. Ein Erfahrungsbericht darüber, was die Werkzeuge gut können, an welchen ganz normalen Stellen sie nicht anschlagen, und wie daraus eine Pipeline in mehreren Durchläufen wurde. Schwärzen sind zwei Aufgaben: finden und entfernen. Warum ein schwarzes Rechteck über dem Text kein Schwärzen istJe Datentyp eine Methode: Muster mit Prüfsumme für IBAN und E-Mail, Eigennamen-Erkennung für Namen und Adressen, ein Bildmodell für den Rest. Presidio als Rahmen, GLiNER für eigene KategorienBei Fotos der Umweg über die Texterkennung: jedes Wort ein Kästchen, die Fundstelle wird zurück aufs Bild gerechnetDie Fälle, die durchgerutscht sind: eine E-Mail-Adresse ohne Punkt vor der Endung, eine IBAN mit Zeilenumbruch in der FußzeileDie Pipeline in Zyklen: erst die schnellen Erkenner, dann ein lokales Bildmodell als Kontrolleur, und alles zurück in den nächsten Durchlauf. Warum die Treffer vereinigt werden, nicht geschnittenVon gefühlt siebzig auf knapp hundert Prozent, und was diese Zahl wert ist, wenn sie nur aus Stichproben stammtZum Nachlesen: Microsoft Presidio: https://github.com/microsoft/presidio GLiNER, Eigennamen-Erkennung mit eigenen Kategorien: https://github.com/urchade/GLiNER PyMuPDF, echtes Schwärzen in PDFs: https://pymupdf.readthedocs.io/ Desert Ant Labs mit dem Redact-Modell aus Folge 190: https://desertant.com/de/ Die Stimmen in diesem Podcast sind künstlich erzeugt. Die Inhalte stammen von uns.

    193 - Dokumente schwärzen
  5. Sep 21

    192 - Jev: Entscheiden statt schreiben

    Mitte September hat das Start-up TypeSafe ein Modell namens Jev vorgestellt, das keinen einzigen Satz schreiben kann. Es kann nur entscheiden: eine von mehreren Möglichkeiten auswählen, auf einer Skala einstufen oder zu einer Ja-Nein-Frage eine Wahrscheinlichkeit liefern. Wir spielen das an zwei Fällen durch, am Support-Postfach eines Mittelständlers und an einem Agenten, der fremde Texte liest. Ausprobiert haben wir es selbst noch nicht, und das sagen wir auch: Was in der Folge steckt, stammt aus der Dokumentation des Herstellers, aus einer unabhängigen Auswertung und aus einem offenen Nachbau. Wie so ein Entscheidungsmodell arbeitet: drei Fragetypen, mehrere Fragen in einem Aufruf, ein einziger Rechendurchlauf statt Wort für WortWie du ihm deine Regeln beibringst, obwohl es kein Training für Kunden gibt: als Beschreibung an jeder Antwortmöglichkeit, mit engen Teilfragen statt einer breitenWann automatisch gehandelt wird und wann ein Mensch draufschaut: Schwellen auf der Sicherheit, gesetzt nach dem Preis eines FehlersPrüfschritte im Agenten: vor dem großen Modell, bei der Werkzeugwahl und hinter der AntwortWo es bricht: Es liest wörtlich, ein Datum ist für es nur Text, und trainiert ist es vor allem auf EnglischEchtes Anlernen mit eigenen Daten geht nur auf dem offenen Weg, und was dabei mit den Wahrscheinlichkeiten passiertZum Nachlesen: TypeSafe, Ankündigung von Jev: https://typesafe.ai/blog/introducing-system-one-models-and-jev Dokumentation: https://docs.typesafe.ai/ Unabhängige Auswertung von Arize: https://arize.com/blog/typesafe-jev-llm-judge/ Offener Nachbau Simple Jev: https://github.com/featherless-ai/simple-jev Ein zweites offenes Modell, Laya: https://huggingface.co/convaiinnovations/laya Desert Ant Labs, das Thema von Folge 190: https://desertant.com/de/ Die Stimmen in diesem Podcast sind künstlich erzeugt. Die Inhalte stammen von uns.

    192 - Jev: Entscheiden statt schreiben

About

Ein KI-generierter Podcasts rund um die Entwicklung von und mit KI. News, Updates und interessante Hintergrundinformationen für den professionellen Einsatz von KI hinaus. Ohne Hype und Buzzwords. Die KI-Gilde ist ein Angebot der YnotBetter UG.

You Might Also Like