TechCrunch AI
Andrew Dai: DeepMind‑Ex, 300 M Pre‑Seed für visuelle KI.
Andrew Dai entwickelt multimodale visuelle KI mit 300 Mio Euro, unterstützt von Google, Meta, NVIDIA.
Weiterlesen
VentureBeat AI
54 % der 107 Unternehmen erleben AI-Agenten-Sicherheitsvorfälle.
Mehr als die Hälfte der Unternehmen erlebt Agentenangriffe, nutzt selten Identitäten, setzt auf große Anbieter.
Weiterlesen
AI Models Digest
Bedingte Speicherung via skalierbare Abruftechnik: Neue Sparsity‑Achse für LLMs.
Conditional‑Memory speichert Wissen in Lookup‑Tabellen, senkt Rechenlast, erhöht Genauigkeit, spart Speicher.
Weiterlesen
MIT AI News
Automatisiertes KI-Framework verbessert 2D‑zu‑3D‑CAD-Generierung für Rapid Prototyping.
MIT-Entwickler schaffen KI-Tool, das 2‑D-Entwürfe automatisch in 3‑D‑Modelle umsetzt und Produktion beschleunigt.
Weiterlesen
arXiv AI Papers
ob reduziert Überlöschung in KI-Trainingsdaten.
Provenance‑Technologie reduziert KI-Model-Löschung von 101‑fach auf 1,3‑fach und verursacht minimalen Durchsatz‑Overhead.
Weiterlesen
arXiv AI Papers
DOBOT nutzt SPINE Agentic AI, um Robotereinbindung zu beschleunigen.
SPINE beschleunigt KI-basierte Robotik‑Einführung, erreicht 100 % Erfolgsquote und reduziert Teleoperationzeit.
Weiterlesen
arXiv AI Papers
OpenAI testet GPT‑4o auf CoT‑Premissen mit ProntoQA.
Interventionelle Grounding‑Audits prüfen LLMs, Methode erzielt F1 0,806, 66 % korrekte Lösungen zeigen 'right‑answer, wrong‑reasoning'.
Weiterlesen
arXiv AI Papers
Neuro-symbolische AGI: probabilistische Erweiterung von Belnap's IFOL_B.
Neuro-symbolische KI kombiniert neuronales Lernen mit symbolischem Beweisen, erweitert IFOL_B probabilistisch, ermöglicht Echtzeit-Entscheidungen.
Weiterlesen
arXiv AI Papers
Selbstoptimierende Agenten nutzen Foundation‑Modelle.
Der Artikel beschreibt ein Framework, das Foundation‑Modelle mit Prompt, Speicher, Tool, Kontrolle verbindet, Operatoren selbstverbessern.
Weiterlesen
arXiv AI Papers
Graphbasierte GNN-Tools stärken kleine Sprachmodelle bei Molekülvorhersagen.
Context‑Enhanced Prompting nutzt GNN‑Experten, liefert graphbasierte Hinweise, erhöht Genauigkeit bis 74 %, reduziert Kosten in Pharma‑Materialforschung.
Weiterlesen
arXiv AI Papers
Oracle präsentiert Agent Memory: datenbank‑basierte Speicherlösung für langfristige KI-Agenten.
Oracle Agent Memory bietet skalierbare, datenbanknative Speicherlösung für KI-Agenten, die Konversationen langfristig speichert.
Weiterlesen
arXiv AI Papers
DROPJ: Menschliche Präferenzen & Weltmodelle für sicheres Agententraining.
DROPJ nutzt menschliche Präferenzen, trainiert ein Belohnungsmodell und optimiert sichere RL mittels MPC.
Weiterlesen
arXiv AI Papers
Mycelium verbindet Wissenschaftler und KI zu kollaborativen Forschungsteams.
Mycelium verbindet Forscher:innen mit KI-Agenten, um Beobachtungen zu analysieren und experimentelle Designs zu entwickeln.
Weiterlesen
arXiv AI Papers
KI-versicherung: Preis, Underwriting, Automatisierung für autonome Agenten.
Eine Studie entwickelt ein Modell zur Risikobewertung und Vertragsgestaltung autonomer KI.
Weiterlesen
arXiv AI Papers
FMDP: Kostenoptimale LLM- und VLM-Bereitstellung im Transportmanagement.
FMDP senkt Kosten um 97 %, ist NP‑schwer, nutzt Heuristik und liefert günstiges Portfolio.
Weiterlesen
arXiv AI Papers
Neues Tool zur dynamischen Anpassung von KI-Agent-Harnesses.
Das neue Handbook verbessert KI-Agenten-Behaviorlokalisierung mit statischer Analyse, LLM und Behavior-Guided Progressive Disclosure, steigert Effizienz.
Weiterlesen
arXiv AI Papers
Neues Paradigma: Theorieweite Autoformalisation verbindet Wissensbibliotheken.
Autoformalization fördert die vollständige maschinelle Verifikation von Theorien als strukturierte Bibliotheken, identifiziert Herausforderungen und Lösungen.
Weiterlesen
arXiv AI Papers
EZSMTV3: Erweiterte CASP-Framework nutzt SMT-Solver.
EZSMTV3 verbindet ASP mit SMT, nutzt CVC5/YICES/Z3, übertrifft CLINGCON und erleichtert Optimierung.
Weiterlesen
arXiv AI Papers
LLM-Agenten meistern Tool‑Vertrauenswechsel im Set‑Shifting-Test.
LLM-Agenten passen ihre Toolauswahl selten bei verborgen wechselnder Zuverlässigkeit an.
Weiterlesen
arXiv AI Papers
LAPO: Rückwärtsaustausch zur Prozessbelohnung in Mehrturn-Suche.
LAPO verbessert QA‑Suchagenten, weist Prozess‑Scores zu, reduziert Irrelevanz, erzielt 0,326 EM ohne Lehrer.
Weiterlesen
arXiv AI Papers
Neues Multi-Agent-Root-Analyse-System übertrifft klassische Modelle bei OpenRCA.
Das neue Multi-Agenten-RCA-System liefert dank multimodaler Telemetrie und Reverse-Reasoning höhere Genauigkeit und verringert Fachwissenbedarf.
Weiterlesen
arXiv AI Papers
UrbanAgent: Multi-Agent-System für Städteprofilierung mit Tool-Unterstützung.
UrbanAgent verbessert urbane Kennzahlen durch multi‑modales Lernen, kollaborative Agenten und Loop, steigert R² um 8,1 %.
Weiterlesen
arXiv AI Papers
KI-Assistenten verringern das Zögern, erhöhen Fehlerquote.
KI-Assistenten erhöhen Vertrauen, trotz niedriger Genauigkeit, und warnen vor unkontrolliertem Einsatz in Entscheidungsprozessen.
Weiterlesen
arXiv AI Papers
Safety Sentry: Dreiweg‑Routing für sichere LLM-Agenten.
Safety Sentry reduziert Fehlentscheidungen bei LLM‑Agenten durch ein Drei‑Pfad‑Routing ohne Latenz‑Overhead.
Weiterlesen
arXiv AI Papers
MEDA: LLM- und symbolische Regression entdecken biologische Differentialgleichungen.
MEDA kombiniert LLM- und Symbolic-Regressionsmethoden, erkennt biologische ODE-Modelle zuverlässig.
Weiterlesen
arXiv AI Papers
STOCKTAKE-Benchmark nutzt Bayes‑Filter zur Bewertung von LLM‑Agents.
STOCKTAKE trennt Fehlermeldungen von Fehlsteuerungen, nutzt Bayes‑Filter für partielle Beobachtbarkeit, erkennt 84‑88 % Fehler.
Weiterlesen
arXiv AI Papers
Neue Benchmark UESF-Bench bewertet Suchen und Folgen von Personen.
Das UESF-Benchmark etabliert neue Messstandards, fordert Agenten und übertrifft Baselines.
Weiterlesen
arXiv AI Papers
Neue Metriken für erklärbare RL mit Induktiver Logikprogrammierung.
Die Autoren entwickeln mit induktivem Logik-Programmieren Metriken für XRL, die Lern-Dynamik und Koordination offenbaren.
Weiterlesen
arXiv AI Papers
AI-Agenten auf GitHub verbessern Open-Source-Koordination.
KI‑Bots in Open‑Source‑Software verbessern Teamorganisation, fördern Zusammenarbeit, reduzieren Konflikte.
Weiterlesen
arXiv AI Papers
AgentCompass: Einheitliche Open-Source-Infrastruktur zur Bewertung von LLM-Agenten.
AgentCompass ist Open‑Source-Framework zur standardisierten Bewertung von LLM-Agenten, inkl. Fehlerdiagnose.
Weiterlesen
arXiv AI Papers
CAVA: Standardisierte Verifikation von Agentenaktionen für Runtime Governance.
CAVA erleichtert Genehmigungsverwaltung, bindet Genehmigungen an Ausführungen und gewährleistet Nachvollziehbarkeit in heterogenen Laufzeitumgebungen.
Weiterlesen
arXiv AI Papers
Experience Memory Graph: Ein‑Shot‑Fehlerkorrektur für LLM‑Agenten.
EMG lernt aus Fehlern, steigert Erfolgsraten in ALFWorld und ScienceWorld, reduziert Kosten, verbessert autonome Entscheidungen.
Weiterlesen
arXiv AI Papers
AIMO und Fields Model Initiative starten Interpretierungswettbewerb für KI-Modelle.
Die AIMO-Interpretability-Challenge prüft Robustheit hochentwickelter Sprachmodelle mit Olympiad‑Level-Mathematikaufgaben.
Weiterlesen
arXiv AI Papers
Open-Source-Agent HealthClaw entwickelt sich selbstständig für lebenslanges Gesundheitsmanagement.
HealthClaw trennt Regeln und Wissen von Daten, aktualisiert Fakten und steigert Genauigkeit von 0,2 % auf 4 %.
Weiterlesen
arXiv AI Papers
Agent-Optimierer prüfen: Kann Kompensation im Terminal-Bench 2.0 erzielt werden?
RELAI‑VCL steigert konstant die Pass‑Rate, während GEPA und Meta Harness nach einigen Runden ansetzen.
Weiterlesen
arXiv AI Papers
AI-gesteuertes Framework beschleunigt Weiterbildung, geprüft von US Board of Accountancy.
Das KI-gestützte Upskilling-Framework beschleunigt Lernprozesse bis 2030, genehmigt von US-Verbänden, und hat mehrere NVIDIA-Zertifikate erzielt.
Weiterlesen
arXiv AI Papers
Lego WeDo2 kombiniert mit Retrieval‑Augmented Generation schafft Earthquaker‑AI‑Bildung.
Ein hybrides Lernsystem kombiniert Lego-Robotik, RAG und KI-Assistenten für genaue Erdbebenvorsorge und selbstreguliertes Lernen.
Weiterlesen
arXiv AI Papers
Deep Interaction ermöglicht präzise Fehlerkorrektur in großen Sprachmodellen.
Deep Interaction korrigiert LLMs’ Chain‑of‑Thought‑Fehler, erhöht Erfolgsrate um 25 % und senkt Tokens um 40 %.
Weiterlesen
arXiv AI Papers
FixItFlow automatisiert Cloud‑Fehlerberichte mit großen Sprachmodellen.
KI-basierte Guides beschleunigen Incident‑Response um 2,3‑fach und senken Wartungsaufwand.
Weiterlesen
arXiv AI Papers
Safe-Psych: Benchmark für sichere psychiatrische Diagnosen mit Sprachmodellen.
Safe‑Psych‑Benchmark offenbart, dass LLMs bei fehlenden Daten über 60 % unterdiagnostizieren, vor allem bei frühen Diagnosen.
Weiterlesen
arXiv AI Papers
Sichere KI‑Anwendung für Gesundheitsinformationen von Mutter & Kind mittels RAG.
Das System kombiniert RAG, Grenzverfolgung, anonyme Sitzungen und Audit-Logging, um sichere Gesundheitsantworten zu liefern.
Weiterlesen
arXiv AI Papers
Claude Sonnet und Gemini 3.5 durch neues Sicherheitsprotokoll geprüft.
Safety‑Conditioned Uplift misst, wie Sicherheitsbedingungen die Nutzen‑Risiko‑Grenze von KI‑Assistenten verschieben; Audit senkte Gefahr um 6,3 %.
Weiterlesen
arXiv AI Papers
Frontier-Modelle vs. Organisation: Endgültige Entscheidungsgewalt in AI-Governance.
Das Paper vergleicht Entscheidungsgewalt bei KI-Integration: Anbieter vs Organisation, basierend auf EU-Act, NIST, Singapore, Japan.
Weiterlesen
arXiv AI Papers
LessonBench-V1: LLM-basiert Benchmark für KI-Lehrplangenerierung von LibreTexts, Brilliant.org und GeeksForGeeks.
LessonBench-V1 verbindet 647 Lektionen zu 240 STEM-Themen aus LibreTexts, Brilliant.org und GeeksForGeeks.
Weiterlesen
arXiv AI Papers
Entkoppelte Transfer‑Learning‑Strategie reduziert Backpropagation bei ResNet und ViT.
Leichtgewichtige Deep‑Learning‑Training reduziert CO₂, passt Normierungsschichten an, trennt Features, nutzt margin‑basierte Verluste.
Weiterlesen
arXiv AI Papers
EPO setzt LLM-Überprüfung für Patente durch.
EPO verlangt strenge Prüfung von KI-Patenttexten; Detektoren haben hohe Fehlpositivrate, logistisches Modell verbessert Genauigkeit strukturell.
Weiterlesen
arXiv AI Papers
Federated Explainable AI: neue Schnittstelle zwischen Datenschutz und Transparenz.
FedXAI verbindet Datenschutz und Erklärbarkeit im federierten Lernen, bietet Methodenüberblick und neue Taxonomie.
Weiterlesen
arXiv AI Papers
Risiko-gestützte Trigger-Regeln für LLM-Auslösung in Streaming.
Forscher entwickeln ein risikobasiertes Trigger-Framework für LLMs, das optimale Schwellen setzt und Turbofan-Anomalien erkennt.
Weiterlesen
arXiv AI Papers
Systematischer Überblick: Autonome UAV‑Routenplanung zur maximalen Abdeckung im Umweltmonitoring.
Systematischer Überblick von UAV‑Routenplanung fokussiert Coverage, Multi‑UAV, nutzt RL und Hybridoptimierung, vernachlässigt Wetterunsicherheit.
Weiterlesen
arXiv AI Papers
Anthropic Claude-Code: Kompression führt zu gefälschten LLM-Ergebnissen aus abgebrochenen Sessions.
Fehlerhafte Agentic‑LLM‑Coding‑Tools speichern abgebrochene Befehle fälschlicherweise als bestätigte Ergebnisse, was fehlerhafte Resultate propagiert.
Weiterlesen
arXiv AI Papers
HRO: Hierarchisches Raum-zu-Objekt-Framework nutzt LLMs für Zero-Shot Navigation.
HRO nutzt LLMs für hierarchische Objektnavigation, reduziert Blindheit, erhöht Trefferquote.
Weiterlesen
arXiv AI Papers
SIFBench: Identifizierbarkeit kombinierter Belastungen aus Rissprofil.
Studie zeigt, Rissbelastungen eindeutig bestimmen zu können, wenn Profilfunktionen linear unabhängig sind, ansonsten ill‑posed.
Weiterlesen
arXiv AI Papers
Aktivationssensor als Risikodetektor für 7‑8B KI‑Modelle.
Residual‑Stream‑Probes erkennen 95–98 % gefährlicher Anfragen, sinken bei XSTest und Transfertests deutlich.
Weiterlesen
arXiv AI Papers
LLMs fördern Codehomogenisierung: 42 als neuer Standard.
KI‑Coding‑Assistenten erhöhen syntaktische Ähnlichkeit und nutzen häufiger Seed 42, bleiben semantisch unverändert.
Weiterlesen
arXiv AI Papers
LLM-Einsatz bei Betrugserkennung: Evidenzlücken sichtbar.
LLM‑Modelle werden zunehmend bei Betrugsbekämpfung eingesetzt, doch Betriebskriterien fehlen, FORTE‑Framework liefert Rollen und Checkliste.
Weiterlesen
arXiv AI Papers
Claude API gegen GLM‑5 Open‑Weights: Kostenvergleich auf NVIDIA Blackwell.
API reduziert Kosten um 88,6 %, während On‑Premise höhere Wartung kostet, aber 40 % Einsparung ermöglicht.
Weiterlesen
arXiv AI Papers
nsfaguard: KI-Guaranten für Agenten, generatives Denken und Echtzeit‑Klassifizierung.
NSFA schützt KI-Agenten mit 185 Risiko-Varianten, 50 ms-Erkennung und 94 % F1.
Weiterlesen
arXiv AI Papers
Codex, OpenCode und Pi vergleichen GPT‑5-basierte Penetration‑Testing-Agenten.
Sicherheits‑Harnesses liefern bei LLM‑Penetration‑Tests nur geringe Vorteile, während reine Codier‑Agenten bereits vieles lösen.
Weiterlesen
arXiv AI Papers
LLM-basierte Codierungsagenten lernen aus Feedback mit automatisiertem Regel-Framework.
LLM-basierte Coding Agents nutzen menschliches Feedback, speichern Regeln persistierend und erreichen 0 % Wiederholung.
Weiterlesen
arXiv AI Papers
Effiziente, privatsphärengestützte Edge-Cloud-LLM‑Inference mittels KV‑Cache.
Edge-Cloud LLM-Inference reduziert Latenz und Datenverkehr durch kombinierten On-Premise Pre-Processing und Cloud-Decoder mit KV-Cache-Authentifizierung.
Weiterlesen
arXiv AI Papers
KI analysiert Software-Engineering-Curricula zur Beschleunigung des Abschlusses.
KI reduziert Bearbeitungszeit für Curriculum-Anpassungen und beschleunigt Studienabschlüsse.
Weiterlesen
arXiv AI Papers
MiMo-V2.5: KVCache-Optimierung für Hybrid SWA und MoE.
Google AI präsentiert MiMo‑V2.5: Hybrid‑SWA, sparse MoE und multimodale Verarbeitung in Produktions‑LLM.
Weiterlesen
arXiv AI Papers
WaterMoE: Expert‑Routing‑Watermarking steigert LLM‑Genauigkeit und Effizienz.
WaterMoE bettet Wasserzeichen in MoE-LLM-Router ein, verursacht 1 % Latenz, bleibt gleich, bis zu 4‑mal schneller.
Weiterlesen
arXiv AI Papers
Neues Triaxial State Space Model revolutioniert globale Wettervorhersage.
TSSM steigert Wettervorhersagen und Genauigkeit bis 61 %, 103,5 % bei 48 h robust bei 80 % fehlenden Daten.
Weiterlesen
arXiv AI Papers
Phase-Aware Knowledge Tracing trennt Lernphasen von Fähigkeit zu Beherrschung.
PAKT, ein Phase-Aware Knowledge Tracing-Framework, verbessert Lernanalyse und übertrifft Baselines um 1,33 % AUC.
Weiterlesen
arXiv AI Papers
STKAN: Kolmogorov–Arnold-Netzwerk optimiert spatio‑temporal Verkehrsprognosen.
STKAN, ein neuronales Netzwerk, verbessert Verkehrsprognosen mit Taylor-Polynomen und übertrifft MLPs bei fünf Benchmarks.
Weiterlesen
arXiv AI Papers
Samba: Hybrid‑Mamba‑Modell verbessert Audio‑Visual Navigation.
Die Samba-Architektur steigert die Navigationserfolge um 11,3 % und nutzt Mamba-Encoder, um Zeit‑Frequenzabhängigkeiten effizient zu erfassen.
Weiterlesen