TechCrunch AI
Anthropic demonstriert KI-Verbesserung bei zehn Benchmarks ohne LeistungseinbuĂźen.
Anthropic präsentiert Prototyp, der zehn Benchmarks gleichzeitig verbessert, ohne Gesamtleistung zu beeinträchtigen.
Weiterlesen
Unite.AI
Anthropic demonstriert Claude-Agenten, die zehn Alignment‑Fehler zuverlässig beseitigen.
Claude-Agenten von Anthropic beseitigen zehn Alignment‑Fehler, verbessern Benchmarks und belegen automatisiertes Post‑Training.
Weiterlesen
MIT Technology Review
Generation Lab entdeckt Anti‑Aging‑Medikament; virtuelle Kraftwerke folgen.
Der MIT Review von Regalado kritisiert Generation Lab's Anti‑Aging-Aussagen, beleuchtet Wissenschaft und Regulierung.
Weiterlesen
arXiv AI Papers
EduRiskX kombiniert neuronale Transformer und symbolische Logik zur FrĂĽherkennung akademischer Risiken.
EduRiskX kombiniert Transformer, F‑Logic und Expertensystem zur frühzeitigen Risikoermittlung mit 90 % Genauigkeit.
Weiterlesen
arXiv AI Papers
LLM‑Agentenpipeline liefert präzisere ICU‑Mortalitäts‑Erklärungen.
XGBoost erzielte AUROC 0,855; KI‑Pipeline verbessert ICU‑Mortalitätsprognose und Erklärbarkeit ohne Datenleck.
Weiterlesen
arXiv AI Papers
Review: Transformer‑basierte Modelle revolutionieren Batteriezustandsüberwachung.
Transformer‑basierte Modelle verbessern Batterieverwaltung, überwinden Datenknappheit, zeigen Praxisrelevanz und On‑Device‑Fähigkeit.
Weiterlesen
arXiv AI Papers
KI‑gestütztes Framework „PICasso“ automatisiert Design von Siliziumphotonik.
PICasso ist KI-gestütztes Framework, das Photonikdesign optimiert, Spezifikations-Erfüllung bis 92,7 % steigert und Insertion‑Loss auf 3,25 dB senkt.
Weiterlesen
arXiv AI Papers
Deterministisches Tool‑Grounded-Framework CIFQA löst komplexe Finanzfragen.
Deterministisches Multi-Agent LLM namens CIFQA trennt Sprachverständnis von numerischer Ausführung, erreicht 95,5 % Genauigkeit bei Festgeldfragen.
Weiterlesen
arXiv AI Papers
CARL nutzt autotelische RL zur Steuerung selbstorganisierender Lenia-Muster.
Der KI-Agent CARL steuert Zellautomaten, entdeckt und lenkt stabile Solitonen.
Weiterlesen
arXiv AI Papers
Accuracy‑Effizienz-Paradox bei On‑Device Energieprognosen; TCO‑Rahmen minimiert Verlust.
Hohe Genauigkeit von Energieprognosen auf Edge-Geräten verursacht Nettoenergieverlust; das TCO‑Framework bündelt Kosten und Batterieverfall.
Weiterlesen
arXiv AI Papers
LLM-Studie zeigt: Größere Kontexte verbessern Literaturüberblicke, doch Kontrollbedarf steigt.
KI erstellt Literaturübersichten, doch größere Kontextfenster führen zu Wiederholungen und fehlenden Schlüsselergebnissen, daher menschliche Nachbearbeitung nötig.
Weiterlesen
arXiv AI Papers
Neuer Relationaler Hypergraph-Transformer (RHT) fĂĽr effizientes Multi-Tabelle-Lernen.
RHT optimiert multi‑Table‑ML, übertrifft Modelle in semantischer Kohärenz und skaliert sparsere Aufmerksamkeit.
Weiterlesen
arXiv AI Papers
GPT‑5.0 übertrifft GPT‑4.1 bei automatisierter Literaturüberprüfung von Krankheitsausbreitungsmodellen.
LLMs ermöglichen automatisierte Literaturübersichten; GPT‑4.1 ~78 %, GPT‑5.0 ~82 %; Feldgenauigkeiten schwanken zwischen 32,4 % und 100 %.
Weiterlesen
arXiv AI Papers
IBM Teleco: Erklärbare XGBoost‑ und RF‑KI zur Churn‑Vorhersage im CRM.
LightGBM mit SHAP erklärt, reduziert Kundenabwanderung um 78 %, integriert Risikoanalysen.
Weiterlesen
arXiv AI Papers
IPW schlägt nicht bei Long-Tail-Inflationsschätzung; Stratifikation überzeugt.
Stratifizierung übertrifft Inverse‑Probability‑Weighting bei Long‑Tail‑Retail‑Daten und bleibt robust.
Weiterlesen
arXiv AI Papers
GROUND verhindert Halluzinationen in Unternehmensanalysen mit LLM durch governierte semantische Definitionen.
GROUND schĂĽtzt Unternehmensdaten, validiert KI-Ausgaben mit genehmigten Metadaten und verhindert Halluzinationen sowie Zeilenverletzungen.
Weiterlesen
arXiv AI Papers
Neue SAREF-basierte Ontologie für verteilte KI‑Workflows Edge‑Fog‑Cloud.
Erweiterte SAREF-Ontologie ermöglicht KI-Deployments für Edge‑Fog‑Cloud mit 90–100 % Erfolg und <80 ms Orchestrierung.
Weiterlesen
arXiv AI Papers
Anian: Sicherheitsgesteuertes multimodales KI-Backend fĂĽr perinatale mentale Gesundheit und Achtsamkeit.
Anian klassifiziert Sprach- und Textdaten in vier Ebenen und blockiert bei hohem Risiko sichere Inhalte.
Weiterlesen
arXiv AI Papers
ChemOntoRule: Aufgabenorientierte Ontologie für KI‑basierte Chemieaufgaben.
ChemOntoRule erzielt 98,7 % Treffer bei 300 Schulchemieaufgaben mittels Ontologie und Python-Regeln.
Weiterlesen
arXiv AI Papers
OpenAI, Meta und Anthropic prüfen KI‑Halluzinationen im TAME Schmerztext.
Bei sieben Modellen verbesserte Cooperative Prompting Schmerzwert‑Extraktion, Authority‑Framed schwankte Abstention, Gemini 2.5/LLama erzeugte erfundene Scores.
Weiterlesen
arXiv AI Papers
ArXiv fĂĽhrt Knowledge Cards ein: Strukturierte Wissenskarte fĂĽr KI-Entscheidungen.
Knowledge Cards dokumentieren KI-Wissen strukturiert und ermöglichen Expertenwissen-Validierung in Energie und Pharma.
Weiterlesen
arXiv AI Papers
20 KI‑Sprachmodelle bevorzugen leichte Aufgaben, meiden Tedium.
Sprachmodelle meiden mühsame Aufgaben, suchen kreative Freischreiben und zeigen stabile Präferenzen.
Weiterlesen
arXiv AI Papers
Prompt‑Framework für LLM‑basierte Robotersonsagen in der HRI.
Ein achtkomponentiges Prompt-Template gewährleistet sichere Interaktion sozialer LLM-Roboter.
Weiterlesen
arXiv AI Papers
TutorTrace‑Datensatz analysiert IDE‑Telemetrie für KI‑gestützte Programmierkurse.
TutorTrace sammelt IDE‑Telemetry, reduziert KI-Anfragezeit um 29 % und verbessert Vorhersagen.
Weiterlesen
arXiv AI Papers
Mixed‑Reality‑System „SecondVoice“ lässt Teilnehmer anonym über virtuelle Proxys sprechen.
SecondVoice nutzt virtuellen Stellvertreter für anonymisierte Beitragsvermittlung, fördert gleichberechtigte Teilnahme und erhöht Nutzungsrate.
Weiterlesen
arXiv AI Papers
LLMs bewerten Stadtnähe nach Namen, nicht Gefahr.
LLMs bewerten Nachbarschaften nach Namen statt Verbrechen; schwarze/hispanische Viertel bekommen niedriger Sicherheitspunkte.
Weiterlesen
arXiv AI Papers
Fehler bei Tool‑Using-Agenten: 70 % Verlust bis Tiefe 6.
Tool‑Using Agent Fehleranalyse zeigt, dass frühzeitige Fehlentscheidungen bei Tiefe 6 die Leistungsfähigkeit um 70 % reduzieren.
Weiterlesen
arXiv AI Papers
Neue LWM‑Technologie optimiert Roboternavigation ohne Beobachtungsrekonstruktion.
Ein neues latentes Weltmodell verbessert Roboternavigation durch lernbasierte Pfadvorhersage ohne Aktionsannotationen.
Weiterlesen
arXiv AI Papers
Strukturiertes Evidenz‑Routing optimiert multimodale Risikovorhersage in Patientenakten.
Ein Router‑Predictor‑Reviewer-Workflow zerlegt Patientenakten zu Zusammenfassungen und evidenzbasierten Risikobewertungen und erzielt vergleichbare AUROC‑Werte.
Weiterlesen
arXiv AI Papers
AffectOmni: Menschenzentrierte, sozial‑künstlerische Affektanalyse via RL.
AffectOmni steigert multimodale Sprachmodelle mit GRPO und Scores, erhöht Emotionsgenauigkeit um 4,66 %.
Weiterlesen
arXiv AI Papers
KI-Agent steuert Atomkraftmikroskop fĂĽr nanoskalige Charakterisierung.
Tool‑Augmented-LLM übersetzt Sprachbefehle in AFM-Funktionen, bewertet Qualität und korrigiert Artefakte; Pilot erreicht gleiche Bildqualität.
Weiterlesen
arXiv AI Papers
Benchmarking KI-Agenten: Lokale LLMs automatisieren Hardwaredesign mit MCP Tool‑Calling.
Local-LLM-Agenten automatisieren Hardware‑Design; Studie testet sieben LLMs, zeigt hohe Erfolgsquote bei gut konfiguriertem Kontext.
Weiterlesen
arXiv AI Papers
GameWAM verbindet Spielwelt mit Aktionen – neues KI-Modell für Video Games.
GameWAM erzeugt in Echtzeit Bildausschnitte und Tastatur‑Maus‑Sequenzen mit höherer Erfolgsrate.
Weiterlesen
arXiv AI Papers
ArXiv-Studie beweist: Änderungen des Harness‑Designs verändern Coding‑Agent-Ergebnisse bei SWE‑bench.
Der Harness-Design verbessert Coding-Agentenleistung, steigert Lösungslänge und Tool-Handhabung von 43 % auf 72 % bei SWE‑Bench.
Weiterlesen
arXiv AI Papers
Agent Mesh deckt Fehler von Retry- und Circuit-Breaking in Service-Mesh auf.
Die Analyse von 147 Incidents zeigt, dass Identitäts‑ und Evidenzdefizite sieben neue Zuverlässigkeitsprimitiven begründen.
Weiterlesen
arXiv AI Papers
Neue Übersicht zu LLM‑Agenten für Zeitreihenanalyse.
Der Survey klassifiziert LLM‑Agenten für Zeitreihen in vier Gruppen und analysiert Architektur, Daten und Leistung.
Weiterlesen
arXiv AI Papers
Token-Wirtschaft bei LLMs: Neue Metrik misst Denkaufwand und Nutzen.
Der Token‑Economy‑Score misst Genauigkeitsgewinne von KI-Modellen gegenüber generierten Tokens auf sieben Aufgaben.
Weiterlesen
arXiv AI Papers
Nur 6,5 % der Neuro‑Symbolik‑Literatur reproduzierbar – neues Audit‑Framework für KI.
Audit zeigt geringe Reproduzierbarkeit bei NSAI-Studien; lediglich 6,5 % sind reproduzierbar.
Weiterlesen
arXiv AI Papers
SKILL.state ermöglicht lange, skalierbare LLM‑Agentenaufgaben ohne Kontextverlust.
SKILL.state reduziert Tokenbedarf und erhöht Genauigkeit, indem es LLM-Agenten einen veränderbaren Zustandspeicher gibt.
Weiterlesen
arXiv AI Papers
Studie prüft Mentalisierung bei GPT-5, GPT-4.1, Gemini 2.0 und DeepSeek.
Studie vergleicht vier LLMs in ökonomischen Spielen, zeigt vielfältige Mentalisierung und GPT‑5 übertrifft Menschen.
Weiterlesen
arXiv AI Papers
LLM-Guardrail mit FBS schĂĽtzt gegen TOCTOU in SAS.
LLM‑Guardrails reduzieren LLM-Stalenheit bis zu 86 % und verlangen gültige Genehmigungen.
Weiterlesen
arXiv AI Papers
FaithSieve nutzt Lean für präzise Bewertung von LLM‑Beweisen.
FaithSieve verbessert KI‑basierte Mathematikbewertung durch granularen Beweischeck und erreicht 81,43 % Fehlerlokalisierung.
Weiterlesen
arXiv AI Papers
ProofEvolve revolutioniert neuro-symbolische Entwicklung fĂĽr automatisierte formale Beweiserstellung.
ProofEvolve verbindet neuronale Modelle mit Lean, nutzt evolutionäre Operatoren, stärkt Wissen und erzielt höchste Erfolgsquote.
Weiterlesen
arXiv AI Papers
Neuer Ansatz FrameFT optimiert Transformers mit sparsamen Fusion‑Frames.
FrameFT reduziert Speicherbedarf bei großen Modellen, indem es spärliche Koeffizientenmatrix verwendet, und liefert vergleichbare Leistungen.
Weiterlesen
arXiv AI Papers
Adaptives Schlussfolgerungsmodell verbessert agentische KI.
Token-Budgets führen in LLMs zu Über‑oder Unterbegründungen, erhöhen Kosten und führen zu Fehlern.
Weiterlesen
arXiv AI Papers
PILOT-Architektur erlaubt Live‑Selbstverbesserung für Langzeit‑KI-Agenten.
PILOT steuert Agenten in Echtzeit, verbessert ihre Fähigkeiten und erzielt 9,8 % höhere Erfolgsquote.
Weiterlesen
arXiv AI Papers
Neues Benchmark Multi2AV bewertet Sicherheit multimodaler Audio‑Video-Generierung.
Der Multi2AV‑Safety Benchmark bewertet 11 024 Angriffe über alle multimodalen Konfigurationen und deckt zwei Fehlerarten auf.
Weiterlesen
arXiv AI Papers
DuMateBench: Benchmark mit 200 realen Aufgaben fĂĽr autonome Agenten.
DuMateBench prĂĽft autonome Agenten mit 200 Aufgaben in acht Szenarien, hybrider Bewertung, zeigt LeistungslĂĽcken.
Weiterlesen
arXiv AI Papers
AgentJudgeBench: LLM-Judge-Benchmark für Agenten-Werkzeugcalls mit GPT‑5.4.
AgentJudgeBench testet über 3 800 DAG-Aufgaben, zeigt Zuverlässigkeit sinkt mit Schwierigkeitsgrad, selbst große Modelle 77‑82 %.
Weiterlesen
arXiv AI Papers
Neues SIGMA-Modell adressiert strukturierten Rausch‑Effekt in kollaborativem MARL.
SIGMA verifiziert Struktur und verbessert Multiagenten‑Koordination durch adaptives Clustering und Intergruppen‑Attention bei Rauschen in StarCraft II.
Weiterlesen
arXiv AI Papers
LLM‑Texterkennung neu: Relationale Überregularisierung erkennt Satzübergänge.
Die neue Methode erkennt KI-Text mit 97 % Genauigkeit und reduziert Falschpositiv auf 1,6 %.
Weiterlesen
arXiv AI Papers
Fünf Grundprinzipien zur Steuerung autonomer KI‑Agenten in Echtzeit.
Modell kontrolliert autonome KI-Agenten, adressiert flüchtige Agenten, unvorhersagbare Aktionen, offene Provisionierung und nutzt fünf Laufzeit‑Primitives.
Weiterlesen
arXiv AI Papers
Gemini‑basierte Co‑Scientist beschleunigt Forschung von Hypothesen bis Publikationen.
Gemini-Co‑Scientist-System beschleunigt Forschung, validiert in Laboren für Materialien, Biologie und CS; autonomes Modell übertrifft Spitzenmodelle.
Weiterlesen
arXiv AI Papers
KI‑Detektoren zeigen hohe Fehlalarmrate bei nicht‑muttersprachlichen Arbeiten nach professionellem Editieren.
Eine Studie zeigt, dass professionelle Bearbeitung KI-Detektoren stark verfälscht.
Weiterlesen
arXiv AI Papers
ArXiv-Studie enthüllt bedingten Transfer für autonomes LLM‑Posttraining.
BCIT optimiert Update‑Wiederverwendung, prüft Kontexte, lehnt Konflikte ab, verbessert Modelle in Finanz‑Reasoning, Text‑to‑SQL und Funktionsaufruf.
Weiterlesen
arXiv AI Papers
Neue Methode GRAPHSU sorgt für tiefgreifendes Unlernen von KI‑Modellen.
Grafisch basiertes Unlearning reduziert Soft‑Leakage um bis zu 49,5 % bei Sprachmodellen und spart Ressourcen.
Weiterlesen
arXiv AI Papers
AgentFold: Multi-Agenten treiben automatische Protein‑Folding-Modellentwicklung voran.
AgentFold automatisiert Protein‑Folding-Modelle und verbessert lDDT um 7,5 % gegenüber Random Search.
Weiterlesen
arXiv AI Papers
ColRel nutzt große Sprachmodelle zur Spaltenerkennung in ERP‑Daten‑Lakes.
ColRel verbessert Spaltenbeziehungen in Datenlagern, nutzt Einbettungen aus Metadaten und Rohdaten, steigert Analyseeffizienz.
Weiterlesen
arXiv AI Papers
DeepChart prüft LLMs: Sind sie zuverlässig in Datencharts.
DEEPCHART-Benchmark zeigt, dass ansprechende KI-Diagramme oft Datenhalluzinationen enthalten.
Weiterlesen
arXiv AI Papers
Kategorizer-Automat revolutioniert Diskont‑Summe in MDPs.
Der Determinismus-Automat klassifiziert Belohnungssequenzen, reduziert Zustände linear und optimiert KI‑Algorithmen in Entscheidungsprozessen.
Weiterlesen
arXiv AI Papers
AI Control Scientist nutzt LLM fĂĽr automatisiertes Regelsystem-Design.
AI Control Scientist automatisiert Reglersysteme mit Sprachmodellen: Anforderungen interpretieren, Regler designen, Code generieren, Parameter optimieren.
Weiterlesen
arXiv AI Papers
Instruct‑to‑Act verbindet Vision‑Language‑Planner mit Weltmodell‑Controller.
Instruct-to-Act kombiniert instruction‑tuned VLMs mit World‑Model‑Controller für robuste sprachgesteuerte Robotik und übertrifft sieben Szenarien.
Weiterlesen
arXiv AI Papers
Neuro-Symbolische KI kombiniert LKG und Solver Routing fĂĽr verifizierbare Logik.
Neuro-symbolische Architektur steigert logisches Denken von Sprachmodellen durch Ontologiegraph und Router.
Weiterlesen
arXiv AI Papers
LiveSim nutzt LLMs zur dynamischen Nutzer‑Simulation im Live‑Stream‑Ökosystem.
LiveSim nutzt LLMs zur Echtzeit‑Simulation dynamischer Nutzer im Livestream‑Ökosystem.
Weiterlesen
arXiv AI Papers
BekchiAI: One‑Click‑Benchmark zur Beobachtung und Steuerung von LLM‑Agenten.
BekchiAI‑Benchmark prüft 13 ReAct‑Agenten auf 7 Aufgaben mit über 2000 Tests, inklusive Goldwerten und Metriken.
Weiterlesen
arXiv AI Papers
C‑Unseen nutzt LLM‑Logik zur Erkennung schwacher Signale in DTKGs.
Das selbstinterpretierbare C-Unseen erkennt schwache Signale in Zeit‑Knowledge‑Graphen mittels LLM‑basierter Extraktion und Chain‑of‑Thought‑Logik.
Weiterlesen
arXiv AI Papers
LLM vs Mensch beim Screening von Scoping‑Reviews: Aufwand, Recall und Konsistenz.
Bei Screening‑Studien ist der Workflow entscheidender als alleiniger Einsatz von LLM‑Modellen.
Weiterlesen
arXiv AI Papers
Robuste, faire Online‑Allokation trotz unzuverlässiger Vorhersagen.
Forscher entwickeln einen robusten, fairen Algorithmus für Online Allokation, der Vorhersagen kombiniert und Disparität reduziert.
Weiterlesen
arXiv AI Papers
Algorithmische Strommärkte riskieren stille Preisabsprache durch KI‑Agenten.
Algorithmische Lernagenten erzeugen stillschweigende Kartelle im Strommarkt; Regulierungsbehörden sollten sie stärker prüfen.
Weiterlesen
arXiv AI Papers
LLM-gestĂĽtzte BiasprĂĽfung automatisierter Jobmatching-Systeme.
Eine Studie präsentiert kostengünstige LLM-Agenten zur Bias‑Auditierung automatisierter Job-Matching-Modelle, zeigt robuste Erkenntnisse und entdeckt Ranking-Stabilitätsprobleme.
Weiterlesen
arXiv AI Papers
Bildbasierte VLMs erkennen Tabellen: Pixel‑Kompression senkt Token‑Kosten.
Studie zeigt, pixelbasierte Tabellenbilder sparen 41 % Tokens und bleiben erkennbar nach Down‑Scaling.
Weiterlesen
arXiv AI Papers
Neues Benchmark prüft agentische Mathematikfähigkeiten von LLMs.
Eine neue Benchmark enthüllt LLMs Schwächen im mathematischen Denken und bewertet ihre agentischen Fähigkeiten.
Weiterlesen
arXiv AI Papers
GraphMemix: neues graphbasiertes Framework für langfristiges multimodales Agenten‑Gedächtnis.
GraphMemix verbessert das Langzeitgedächtnis multimodaler Agenten durch evidenzbasierte Auswahl und optimierte Forest‑Strategien.
Weiterlesen
arXiv AI Papers
DSA: Evidenz‑bewusste Orchestrierung mit LLM‑Agenten für Börsenforschung.
DSA orchestriert multiregionale Börsenerforschung, strukturiert Evidenz, analysiert Modelle, berichtet über Risikoprävention in zwei Varianten.
Weiterlesen
arXiv AI Papers
ASIL ersetzt Screenshot‑Click durch strukturierte JSON‑Observations und semantische Aktionen.
ASIL ermöglicht KI-Agenten effiziente Steuerung von Anwendungen über JSON, steigert Erfolg um >30 Punkte.
Weiterlesen
arXiv AI Papers
Neues Multi-Modales KI‑Framework zur Echtzeit-Warteschlangenvorhersage in Grenzkontrollen.
KI-Framework reduziert Grenzwartezeiten um 30 %, senkt Prognosefehler 35 % und steigert Durchsatz 20 %.
Weiterlesen