|
$ ki-news --datum 2026-08-01 | mail
KI-News — 1. August 2026
// die viralsten KI-Themen der letzten 24 Stunden, kuratiert für deinen Stack
$ cat top-story.md
DeepSeek hat sein Flash-Modell (284B Parameter, 13B aktiv) neu nachtrainiert und als offizielle Public-Beta-API veröffentlicht. Bei identischer Architektur springen die Agenten-Benchmarks deutlich über die bisherige Pro-Preview-Version (Terminal-Bench 2.1: 82,7; DeepSWE: 54,4; Cybergym: 76,7), und das Modell unterstützt jetzt nativ das Responses-API-Format inklusive Codex-Anpassung.
Warum relevant: Extrem günstige Agenten-Fähigkeiten für Coding-Workflows (z. B. in OpenCode) zum Bruchteil der Kosten proprietärer Frontier-Modelle — lokales Hosting hakt laut ersten Tests aber noch (siehe Self-Hosting-Rubrik unten).
// quelle: DeepSeek API Changelog · weitere Einordnung bei simonwillison.net
## 🛠️ Tools & Repos
Nous Researchs "self-improving AI agent" baut während der Nutzung eigene Skills und ein Nutzermodell auf, läuft auf VPS/GPU-Clustern oder serverless und lässt sich an Telegram, Discord, Slack & Co. anbinden — diese Woche mit massivem Star-Zuwachs auf GitHub Trending. Warum relevant: Interessanter Baustein für persistente, selbstgehostete Agenten mit Langzeitgedächtnis — aber ein Hermes-Agent im "YOLO-Modus" wurde bereits für einen realen Angriff missbraucht, sauberes Sandboxing ist Pflicht. // GitHub Trending
Strix schickt spezialisierte Agenten für Recon, Exploitation und Post-Exploitation parallel auf eigene Anwendungen los und liefert echte Proof-of-Concept-Exploits statt Fehlalarmen plus automatisch generierte Patches — komplett lokal, ohne Cloud-Account. Warum relevant: Zeigt praxisnah, wie sich Multi-Agenten-Orchestrierung für eigene Sicherheitschecks der selbstgehosteten Stack-Komponenten (vLLM, Qdrant, OpenWebUI) nutzen lässt. // GitHub Trending
## 🤖 Agenten & MCP
Simon Willison erklärt, warum die neue MCP-Spezifikation 2026-07-28 aus Client- und Server-Sicht "so viel sauberer" ist: Ein einzelner HTTP-Request ersetzt Initialisierung plus Tool-Aufruf, Server müssen keine Session-IDs mehr verwalten. Drei neue Mini-Tools (mcp-explorer, datasette-mcp, llm-mcp-client) zeigen, wie schnell sich jetzt MCP-Server bauen lassen. Warum relevant: Für eigene MCP-Server im RAG-/Agenten-Stack wird die Implementierung spürbar einfacher und leichter zu auditieren als klassische Shell-/Internet-Zugriffe. // simonwillison.net
Claude Opus 5 ist jetzt Standard-Opus-Modell in Claude Code (1M Kontext, Fast Mode für 10/50 $ pro Mtok). Neu: sandbox.network.strictAllowlist blockiert nicht freigegebene Hosts für Sandbox-Kommandos ohne Rückfrage, und verschachtelte Subagenten sind jetzt bis Tiefe 3 möglich (vorher 1). Warum relevant: Direkt nutzbare Sicherheits- und Architektur-Verbesserungen für alle, die Claude Code mit MCP-Servern und mehrstufigen Subagenten-Setups fahren. // Claude Code Changelog
## 🏠 Self-Hosting & RAG
Ein ausführlicher Guide zeigt, was es braucht, um das 568-GB-Modell per modifiziertem llama.cpp-Build und GGUF-Quantisierung auf einer RTX PRO 6000 oder per Cloud-GPU lokal laufen zu lassen — Fazit: aktuell "nicht empfehlenswert", da weder Ollama noch LM Studio die V4-Architektur offiziell unterstützen. Warum relevant: Erspart Zeit, bevor man das eigene vLLM-Setup mit einem noch nicht production-ready Modell testet — lohnt sich als Beobachtungsposten für den nächsten llama.cpp-Release. // DataCamp
## 📰 Lesenswert
Googles KI-gestützte Security-Pipeline auf Gemini-Basis fand und patchte allein im Juni 1.072 Chrome-Sicherheitslücken — mehr als in den vorherigen 23 Versionen der letzten zwei Jahre zusammen, darunter ein 13 Jahre alter Sandbox-Escape-Bug. Warum relevant: Konkreter Beleg, wie weit Agenten-Harnesses für Fehlersuche und -behebung inzwischen skalieren — ein Muster, das sich auf eigene Codebases übertragen lässt. // TechCrunch
GPTZero fand in vier PwC-Middle-East-Reports gefälschte Zitate, tote Links und frei erfundene Studien — ein Bericht gilt als zu 84 % vollständig KI-generiert. Das Phänomen "Vibe Citing" (Quellen klingen plausibel, belegen die Aussage aber nicht) war zuvor schon bei KPMG, Deloitte und EY aufgefallen. Warum relevant: Mahnendes Beispiel für jeden RAG-/LLM-Workflow ohne Zitat-Verifikation — Grounding und Quellenprüfung sind kein Nice-to-have. // the-decoder.com
$ echo "automatisch recherchiert am 2026-08-01"
> ki-news · news.reichenberg.ruhr
[ abbestellen ]
[ im browser ansehen ]
|