GPT-5.6 Sol übertrifft Claude Mythos auf Coding-Benchmarks — US-Regierung limitiert Zugang auf ausgewählte Partner.
​​​​​​​​​​

$ ki-news --datum 2026-06-27 | mail

KI-News — 27. Juni 2026

// die viralsten KI-Themen der letzten 24 Stunden, kuratiert für deinen Stack

$ cat top-story.md

OpenAI GPT-5.6 Sol: Neues Flaggschiff übertrifft Claude Mythos im Coding — US-Regierung beschränkt Zugang

OpenAI hat GPT-5.6 Sol vorgestellt, aufgeteilt in drei Stufen (Sol, Terra, Luna). Sol übertrifft Claude Mythos 5 auf zentralen Coding-Benchmarks: 91,9 % vs. 88 % auf TerminalBench 2.1, mit höherer Token-Effizienz bei Cybersecurity-Aufgaben. Die Preise liegen bei 5 $/Mio. Input-Tokens und 30 $/Mio. Output-Tokens. Die US-Regierung schränkt die Verfügbarkeit per Exportkontrolle ein — öffentlicher Zugang bleibt vorerst auf ausgewählte Partner beschränkt.

Warum relevant: Das stärkste öffentliche LLM in Coding-Benchmarks wechselt die Nummer-1-Position — wichtiger Datenpunkt für die Wahl zwischen Claude Code, Codex und Alternativen.

// quelle: The Decoder · Washington Post

## 📦 Modelle & Releases

Anthropic Mythos 5 wieder freigeschaltet: ~100 US-Organisationen über Project Glasswing

Nach zwei Wochen Exportkontroll-Sperre (Fable 5 + Mythos 5) erlaubt die US-Regierung Anthropic, Mythos 5 an rund 100 Unternehmen und Behörden zurückzugeben — darunter Cisco und JPMorgan Chase für defensive Cyber-Zwecke. Fable 5 bleibt vorerst gesperrt. Warum relevant: Wer Enterprise-Zugang zu Mythos 5 braucht, sollte Project-Glasswing-Voraussetzungen prüfen — der Zugang läuft über Bestandspartner. // Anthropic Blog · CNBC, 26. Juni

## 🤖 Agenten & MCP

MirrorCode-Benchmark: Claude Opus 4.7 löst 56 % autonomer Coding-Aufgaben — bis zu 19 Tage am Stück

Epoch AI und METR veröffentlichten MirrorCode: Modelle reimplementieren komplette Programme ohne Originalcode, Budget bis 2.600 $ pro Aufgabe. Claude Opus 4.7 führt mit 56 % (GPT-5.5: 44 %, Gemini 3.1 Pro: 32 %); eine Aufgabe lief ununterbrochen 19 Tage. Beispiel: 16.000-Zeilen-Bioinformatik-Toolkit in 14 Stunden für 251 $ reimplementiert. Warum relevant: Der realistischste Maßstab bisher für Langzeit-Agenten-Workflows — und dein Claude-Code-Stack ist hier klar vorne. // The Decoder, 26. Juni

## 🏠 Self-Hosting & RAG

OpenWebUI v0.9.6: Knowledge-Base-Sync mit inkrementeller Verzeichnis-Synchronisation

Das neue Release bringt ein offizielles Knowledge-Base-Sync-Tool: inkrementelle Verzeichnis-Synchronisation mit automatischer Bereinigung, Ordnerstruktur für Wissensbasen und Dateibenennung — plus Performance-Fixes bei Websocket-Disconnect und Tool-Abfragen. Warum relevant: Wer Dokumente per Python-Pipeline in OpenWebUI + Qdrant pflegt, kann dieses Sync-Tool als Drop-in für Custom-Glue-Code nutzen. // GitHub, Juni 2026

vLLM v0.23.0: DeepSeek-V4 Hardening, Multi-Tier KV-Cache-Offloading, Rust-Frontend

Neues Release (Mitte Juni): DeepSeek-V4 erhält TRTLLM-Attention-Kernel und EPLB-Support; Model Runner V2 ist nun Standard für Llama und Mistral. Highlight: Multi-Tier KV-Cache-Offloading auf Object-Store als sekundären Tier plus experimentelles Rust-Frontend mit Streaming-Endpoint. Gemma 4 Unified läuft jetzt encoder-frei. Warum relevant: KV-Cache-Offloading auf S3/Object-Store reduziert den GPU-RAM-Bedarf deines vLLM-Stacks — ideal für große Kontextfenster bei Gemma. // GitHub / vLLM Blog

## 🛠️ Tools & Repos

xbtlin/ai-berkshire — Value-Investing-Research-Framework auf Claude-Code-Basis

Heute +1.274 Stars auf GitHub Trending: Ein Python-Framework, das Claude Code als autonomen Research-Agenten für fundamentales Value Investing einsetzt — automatisierte Analyse von Geschäftsberichten, Kennzahlenauswertung und Thesen-Generierung ohne manuelle Eingriffe. Warum relevant: Blueprint dafür, wie weit Claude Code inzwischen als eigenständiger Analyse-Agent taugt — übertragbar auf beliebige Domänen-Research-Pipelines. // GitHub Trending, 27. Juni

## 🎬 Sehenswert

So erkennt jeder KI-Inhalte — auch generierte Videos (c't 3003, DE)

Das c't-3003-Team testet Tools und Methoden zum Erkennen KI-generierter Bilder und Videos — was wirklich funktioniert und wo die Grenzen liegen. Warum relevant: Praxiswissen für alle, die KI-Content unterscheiden oder nach EU AI Act korrekt kennzeichnen müssen. // c't 3003, 26. Juni 2026

## 📰 Lesenswert

Lindy wechselt komplett zu DeepSeek — Claude-Kosten übertrafen Personalausgaben des 25-köpfigen Teams

CEO Flo Crivello berichtet, dass die API-Kosten für Claude „nicht mehr tragbar" waren und die gesamten KI-Ausgaben die Lohnkosten übertrafen — der Wechsel zu DeepSeek spart „Millionen". Rückkehr zu Claude ist offen, aber erst bei Preissenkung. Warum relevant: Realer Datenpunkt für die Make-or-buy-Frage zwischen Claude API und Self-Hosted Inference (dein vLLM-Stack). // The Decoder, 26. Juni

Anthropic stellt keine Junior-Entwickler mehr ein — Jack Clark warnt vor Wirtschaftsschock

Mitgründer Jack Clark erklärt, Anthropic konzentriere sich auf erfahrene Fachleute, weil KI deren Produktivität vervielfacht. Gleichzeitig warnt er vor einem ökonomischen Paradoxon: hohes BIP-Wachstum kombiniert mit struktureller Arbeitslosigkeit — für das Regierungen weltweit nicht vorbereitet sind. Warum relevant: Erstes explizites Signal von innen, dass KI Junior-Jobs in Tech strukturell ersetzt — mit absehbarem Spillover in andere Branchen. // The Decoder, 26. Juni

Xcode 26.6: Google Gemini als Coding-Assistent — wählbar neben Claude und Codex

Apple integriert in Xcode 26.6 Google Gemini als weiteres KI-Modell: Entwickler können jetzt direkt zwischen Gemini, Claude (Anthropic) und OpenAI Codex wechseln, ohne auf Herbst-Releases zu warten. Warum relevant: IDEs konvergieren auf einen Multi-Modell-Standard — analog zu dem, was MCP für Tool-APIs erreicht. // heise online, 26. Juni

Akrites: Linux Foundation gründet Industrieallianz gegen KI-gestützte Angriffe auf Open Source

Mit ~20 Tech-Unternehmen (Amazon, Google, Microsoft, OpenAI, NVIDIA u.a.) startet die Linux Foundation Akrites: ein zentrales SIRT koordiniert KI-gefundene Schwachstellen in Open-Source-Projekten und springt bei verwaisten Repos als „Maintainer of Last Resort" ein. Warum relevant: KI-Scanner finden heute in Minuten Lücken in selbst-gehosteten Abhängigkeiten — Akrites schließt die organisatorische Lücke in der Patch-Koordination. // The Decoder, 26. Juni

$ echo "automatisch recherchiert am 2026-06-27"
> ki-news · news.reichenberg.ruhr

[ abbestellen ] [ im browser ansehen ]