Gemini-Lead Noam Shazeer wechselt zu OpenAI — die KI-Personalie des Jahres.
​​​​​​​​​​

$ ki-news --datum 2026-06-19 | mail

KI-News — 19. Juni 2026

// die viralsten KI-Themen der letzten 24 Stunden, kuratiert für deinen Stack

$ cat top-story.md

Google verliert Gemini-Lead Noam Shazeer an OpenAI

Noam Shazeer — Co-Autor des Papers „Attention Is All You Need", Mitgründer von Character.AI und zuletzt VP of Engineering für Googles Gemini-Modelle — verlässt Google erneut und wechselt zu OpenAI. Erst 2024 war er im Rahmen eines 2,7-Milliarden-Dollar-Deals zurückgekehrt, um Googles Reasoning-Fähigkeiten zu stärken. The Decoder bezeichnet den Wechsel als „bislang wohl größte KI-Personalie in diesem Jahr" — vergleichbar nur mit Andrej Karpathys Wechsel zu Anthropic.

Warum relevant: Shazeer hat mehr Grundlagen-Paper mitgeschrieben als die meisten Labore Mitarbeiter haben. Sein Wechsel signalisiert, dass OpenAI im Talent-Kampf gerade die Nase vorn hat — und Googles Gemini-Roadmap erneut unter Druck gerät.

// quelle: The Decoder

## 📦 Modelle & Releases

vLLM v0.23.0: DiffusionGemma, Multi-Tier-KV-Cache & Model Runner V2 per Default

Das bisher größte vLLM-Release dieses Jahres (408 Commits, 200 Contributors) bringt erstmals nativen Diffusions-LLM-Support (DiffusionGemma 26B), wählt Model Runner V2 jetzt per Default für Llama und Mistral, zielt auf Transformers v5 und führt Multi-Tier-KV-Cache-Offloading ein — inklusive Objekt-Store als Secondary Tier und DeepSeek-V4-Verbesserungen für Mega-MoE. Warum relevant: Wer vLLM auf dem eigenen Stack betreibt, bekommt mehr Flexibilität beim KV-Cache-Management und kann Diffusions-LLMs direkt über die gewohnte API testen. // GitHub · vllm-project

## 🤖 Agenten & MCP

Claude Code Artifacts: Arbeitsergebnisse werden zu teilbaren interaktiven Webseiten

Anthropic bringt Artifacts als Beta für Team- und Enterprise-Kunden: Claude-Code-Sitzungen lassen sich auf Knopfdruck in teilbare, interaktive Webseiten umwandeln — mit Versionshistorie und automatischer Aktualisierung unter derselben URL. Anwendungsfälle: PR-Walkthroughs, Incident-Timelines, Architektur-Übersichten, Lizenz-Audits. Warum relevant: Agenten-Outputs werden teamfähig — kein Copy-Paste mehr, nur eine URL. // The Decoder

Google DeepMind: AI Control Roadmap für sichere KI-Agenten

DeepMind veröffentlicht ein Sicherheits-Framework, das KI-Agenten wie potenzielle Insider-Bedrohungen behandelt: Berechtigungen werden schrittweise nur auf Basis verifizierten Verhaltens erteilt, Supervisor-KIs überwachen Reasoning und Aktionen in Echtzeit. Das Framework basiert auf MITRE ATT&CK und definiert eskalierbare Überwachungs- (D1–D4) und Reaktionsstufen (R1–R3). Warum relevant: Wer eigene Agenten-Pipelines mit Bash- oder Datei-Zugriff betreibt, bekommt hier ein konkretes Sicherheitsmodell zum Adaptieren. // The Decoder

Adobe baut KI-Agenten in Photoshop, Premiere & die gesamte Creative Cloud

Adobe startet öffentliche Betas von KI-Agenten in Photoshop (Hintergrundwechsel, plattformspezifisches Skalieren), Premiere (Materialsorter, automatischer Rohschnitt), Illustrator, InDesign und Frame.io. After Effects folgt in geschlossener Beta. Die Tools sind bereits in ChatGPT, Claude und Microsoft 365 Copilot integriert. Warum relevant: Der De-facto-Standard für Creative Software bekommt Agenten-Unterbau — und setzt Claude bereits als Backend ein. // The Decoder

## 🏠 Self-Hosting & RAG

DiffusionGemma 26B: Erstes Diffusions-LLM nativ in vLLM

DiffusionGemma ist ein 26B-Parameter-Modell auf Gemma-4-Basis, das Text nicht autoreggressiv, sondern durch iteratives Entrauschen erzeugt (diskretes Diffusionsverfahren). Die vLLM-Integration erforderte bidirektionale Attention, Block-basierte Generierung und einen neuen ModelState-Abstraction-Layer. Warum relevant: Wer vLLM auf eigenem Server betreibt, kann jetzt das Diffusions-LLM-Paradigma direkt ausprobieren — ohne neuen Inference-Stack. // vLLM Blog

OpenWebUI v0.9.6: Knowledge-Base-Sync mit 40+ Quellen & Dateisystem-Tool

Das neue Release bringt oikb — ein Tool zur inkrementellen Synchronisierung von Wissensdatenbanken mit lokalen Verzeichnissen, GitHub-Repos und 40+ weiteren Quellen per Datei-Checksum. Außerdem neu: ein integriertes Dateisystem-Tool, das KI-Modellen erlaubt, Knowledge-Base-Inhalte mit ls, cat und grep zu durchsuchen. Warum relevant: Wer OpenWebUI als RAG-Frontend nutzt, bekommt jetzt eine deutlich mächtigere Wissensbasis ohne externe Pipeline-Skripte. // GitHub · open-webui

## 🎬 Sehenswert

Autonome KI-Drohnen sind jetzt da | c't 3003 #28

c't 3003 zeigt, wo autonome KI-Drohnen heute schon einsatzfähig sind — Militär, Zivil, Regulierung — fundiert und ohne Hysterie. Warum relevant: Guter Orientierungsrahmen, um einzuschätzen, was bei autonomen KI-Systemen technisch und rechtlich gerade passiert. // YouTube · c't 3003 (DE), 18. Juni 2026

I figured out the best way to vibe code

Matthew Berman zeigt seinen optimierten KI-Coding-Workflow — konkrete Techniken statt Hype, basierend auf echten Projekterfahrungen mit Claude Code und ähnlichen Tools. Warum relevant: Direkt anwendbare Strategien für effizienteres Agenten-Coding. // YouTube · Matthew Berman (EN), 18. Juni 2026

## 📰 Lesenswert

Yann LeCun warnt vor „großer Blasenexplosion" in der KI-Branche

Der AMI-Labs-Gründer sagt, alle großen KI-Labore verlören Geld — ihre Dienste seien durch Investoren subventioniert. Ohne sinkende Betriebskosten oder steigende Preise drohe eine Blase. Interessenkonflikt beachten: LeCun setzt selbst auf ein konkurrierendes Paradigma (World Models). Warum relevant: Eine kritische Gegenperspektive zum LLM-Hype, die jeder einordnen können sollte. // The Decoder

Speculative Decoding: Wie Multi-Token Prediction LLMs beschleunigt

Heise erklärt fundiert, wie Speculative Decoding und Multi-Token Prediction (MTP) funktionieren: Ein kleines Draft-Modell schlägt Token-Sequenzen vor, ein größeres Modell verifiziert sie parallel — was die Inferenzgeschwindigkeit auf gleicher Hardware deutlich steigert. Warum relevant: Wer vLLM oder llama.cpp auf eigenem Server betreibt, sollte wissen, welche Decoding-Strategien wann sinnvoll sind. // heise online

$ echo "automatisch recherchiert am 2026-06-19"
> ki-news · news.reichenberg.ruhr

[ abbestellen ] [ im browser ansehen ]