vLLM 0.25 wirft PagedAttention raus — Pflichtlektüre für jeden Self-Hoster
​​​​​​​​​​

$ ki-news --datum 2026-07-12 | mail

KI-News — Sonntag, 12. Juli 2026

// die viralsten KI-Themen der letzten 24 Stunden, kuratiert für deinen Stack

$ cat top-story.md

vLLM v0.25.0: PagedAttention fällt, Model Runner V2 wird Standard

vLLM hat Version 0.25.0 veröffentlicht — die größte Architekturumstellung seit Langem. Model Runner V2 ist jetzt für alle dichten Modelle Standard, die alte PagedAttention-Implementierung wurde komplett entfernt. Dazu kommen eine neue Streaming-Parser-Engine für Tool-Calls und Reasoning, FP8-MoE-Support fürs Transformers-Backend sowie Support für neue Modelle wie GLM-5, DeepSeek-V3.2 und Hy3.

Warum relevant: Wer wie du vLLM als Inference-Server für den eigenen RAG-Stack betreibt, sollte vor dem nächsten Update die Release Notes lesen — das ist ein Major-Architekturwechsel, kein Routine-Patch, und kann Custom-Configs betreffen.

// quelle: vLLM GitHub Releases

## 📦 Modelle & Releases

OpenAI bringt GPT-Live: Sprachmodelle, die gleichzeitig hören und sprechen

GPT-Live und GPT-Live-1 mini nutzen eine Full-Duplex-Architektur: Das Modell kann während des Zuhörens schon reagieren (kurze "mhmm"-Einwürfe statt striktem Abwechseln) und delegiert bei komplexeren Fragen im Hintergrund an GPT-5.5. Warum relevant: Zeigt die Richtung für Voice-Interfaces in Agenten-Setups. // TechCrunch

## 🛠️ Tools & Repos

awesome-llm-apps: 100+ fertige Agent- und RAG-Apps zum Klonen

Über 100 lauffähige Beispielprojekte quer durch Agenten, RAG-Pipelines, MCP-Integrationen und Multi-Agent-Teams, provider-agnostisch für Claude, Gemini, OpenAI, Qwen & Co. Aktuell 118.000+ Sterne, allein heute rund 550 neue. Warum relevant: Gute Fundgrube für Referenzimplementierungen, die sich direkt auf deinen vLLM/Qdrant-Stack übertragen lassen. // GitHub Trending

## 🤖 Agenten & MCP

Claude Code auf Desktop bekommt eingebauten Browser

Claude Code Desktop kann jetzt selbst im Browser navigieren — Docs, Designs oder beliebige Seiten öffnen, klicken und interagieren, genau wie bei lokalen Dev-Server-Previews. Sandboxed, konfigurierbar, mit Sicherheits-Klassifizierern für Aktionen auf fremden Seiten. Warum relevant: Spart den Umweg über einen MCP-Browser-Server für schnelle Recherche- oder Doku-Checks direkt aus der Session. // Claude Code "What's new"

claude-code-templates: CLI zum Konfigurieren & Monitoring von Claude Code

Über 100 fertige Komponenten — Agenten, Custom Commands, Hooks, MCP-Integrationen — plus ein Dashboard (aitmpl.com) zum Durchstöbern und Installieren kompletter Setups mit einem Befehl. 29.100 Sterne, heute +232. Warum relevant: Schneller Einstieg für neue Claude-Code-Projekte, ohne Skills und Hooks von Grund auf selbst zu bauen. // GitHub Trending

## 🏠 Self-Hosting & RAG

Ollama v0.32.0-rc0: früher Support für Qwen3.5/Next

Der Release Candidate bringt einen eigenen Parser/Renderer für Qwen3.5/Next, warnt beim Start vor veralteten Agenten-Modellen und legt die Basis für ein neues Agent-UI-Kommando. Warum relevant: Wer neue Qwen-Modelle lokal testen will, kommt hier schon vor dem Stable-Release ran — sofern ein RC-Build okay ist. // Ollama GitHub Releases

## 🎬 Sehenswert

KOMPLETTER HERMES KURS (Anfänger bis Profi!!)

Einsteiger-bis-Profi-Kurs zum lokalen Agenten-Framework Hermes, das zuletzt mehrfach in der Community auftauchte (u. a. bei c't 3003 in Kombination mit Qwen 3.6). Warum relevant: Praktischer Einstieg, falls du Hermes für eigene lokale Agenten-Workflows evaluieren willst. // Niklas Steenfatt / YouTube DE

GPT-5.6 ist also auf "Mythos-Niveau"?

Deutschsprachiger Praxistest, der GPT-5.6 Sol gegen Anthropics Mythos-Modell antreten lässt und einordnet, wie ernst die Marketing-Vergleiche der letzten Tage zu nehmen sind. Warum relevant: Kompakte, unabhängige Einordnung abseits der Presseberichte. // The Morpheus Tutorials / YouTube DE

## 📰 Lesenswert

Apple verklagt OpenAI wegen Diebstahls von Geschäftsgeheimnissen

Apple wirft OpenAI in einer Bundesklage vor, systematisch Geschäftsgeheimnisse übernommen zu haben — über 400 Ex-Apple-Mitarbeiter arbeiten inzwischen bei OpenAI, Hardware-Chef Tang Tan soll Bewerber zum Mitbringen von Apple-Bauteilen aufgefordert haben. OpenAI weist die Vorwürfe zurück. Warum relevant: Zeigt, wie stark sich die einstigen Partner (ChatGPT in iOS) inzwischen im Hardware-Rennen als Konkurrenten gegenüberstehen. // TechCrunch

Anthropic führt "Reflect" ein — eine Art Jahresrückblick für deine Claude-Nutzung

Die neue Beta-Funktion zeigt, wofür du Claude in den letzten Monaten genutzt hast, ordnet das ins 4D-Framework (Delegation, Description, Discernment, Diligence) ein und bietet Einstellungen für Ruhezeiten und Pausen-Erinnerungen. Warum relevant: Nützliches Selbstreflexions-Tool für Heavy-User — zeigt aber auch, wie genau Anthropic dein Nutzungsverhalten inzwischen auswertet. // Anthropic

$ echo "automatisch recherchiert am 2026-07-12"
> ki-news · news.reichenberg.ruhr

[ abbestellen ] [ im browser ansehen ]