AI News
EvoâŻ2: Stanford erstellt phagen gegen E. coli.
Stanford synthetisiert 300 Phagen mit EvoâŻ2, testet 16 gegen E. coli.
Weiterlesen
arXiv AI Papers
Agentic Nesting: Neue Integrationsmethode fĂŒr Unternehmensanwendungen.
KIâAgents kapseln LegacyâApps, zentraler Orchestrator verteilt Aufgaben, reduziert Kopplung.
Weiterlesen
arXiv AI Papers
Ignition Index misst globale Arbeitsbereichsdynamik in Sprachtransformern.
OpenAI entwickelt den Ignition Index, um die globale Arbeitsbereichstheorie in Transformer-Modellen zu quantifizieren.
Weiterlesen
arXiv AI Papers
Woodpecker Distillation nutzt schwache Modelle, um Fehler in starken Sprachmodellen zu beheben.
Woodpecker Distillation verbessert mathematisches Denken in LLMs durch Fehlerpatching und kontrastive Interventionen.
Weiterlesen
arXiv AI Papers
Gradient-Boosted Modelle erreichen gleiche Genauigkeit bei Schlaganfallprognose.
Guidelineâbasierte kategorisierte GradientâBoostingâModelle erhöhen Akzeptanz bei Schlaganfallprognosen.
Weiterlesen
arXiv AI Papers
SkillTrace: MultitraceâAuditing fĂŒr die Wiederverwendung von LLMâAgentenâSkills.
SKILLTRACE verfolgt LLMâAgentenfĂ€higkeiten und liefert mit hoher Genauigkeit ReviewâQueues.
Weiterlesen
arXiv AI Papers
Neue abstrakte Ereigniskausalregeln: Multiagenten induzieren generalisierte Logik.
Studie entwickelt AECR, CACI, ARâGCAE fĂŒr verbesserte Ereignisvorhersagen.
Weiterlesen
arXiv AI Papers
Otter: 15M-Parameter-Schach-AI ĂŒbertrifft Maia 2.
Otter, 15-Millionen-Parameter-SchachâKI, erzielt neuen menschlichen ZugvorhersagerĂŒckhalt, 55,23âŻ% Topâ1 und ĂŒbertrifft MaiaâŻ2.
Weiterlesen
arXiv AI Papers
SearchAuditBench: LLM-Checker fĂŒr Open-Weight Suchagenten.
SearchAuditBench definiert neue Fehlerdiagnose-Standards fĂŒr DeepâSearch-Agenten, sammelt 1âŻ243 annotierte Fehler und erreicht 32,3âŻ% EndâtoâEndâPass.
Weiterlesen
arXiv AI Papers
Phoneme-getriebene 3D Gaussian Splatting verbessert realistische Talking Heads.
PDâGS reduziert LippenâGlĂ€ttung, kombiniert 3DâGaussianâSplatting mit phonemischen Tokens, und erzielt bestes Ergebnis.
Weiterlesen
arXiv AI Papers
Privilegierte Distillation: StateâMatched Routing + SelfâDistillation fĂŒr MultiâTurn-Agenten.
SMRCâSD erhöht Agentenerfolge, indem es ZustandsĂŒbereinstimmung prĂŒft und privilegierte RĂŒckmeldungen nutzt.
Weiterlesen
arXiv AI Papers
Kleinere KIâModelle erfassen menschliches Verhalten: 14 Modelle, 135Mâ14B Parameter.
Kleine GPTs replizieren menschliche Entscheidungen; 14 Modelle zeigen stabile Leistung, gröĂere generalisieren besser.
Weiterlesen
arXiv AI Papers
Graph-basierte Projektplanung fĂŒr autonome Forschung: Project2Task vorgestellt.
KI-gestĂŒtzte Projektplanung erstellt Aufgabengraphen, verbessert QualitĂ€t, reduziert Redundanz und erleichtert Forschungsauswertung.
Weiterlesen
arXiv AI Papers
TriQua fĂŒhrt adaptive Faktenstruktur fĂŒr prĂ€zise LLM-FaktenprĂŒfung ein.
TriQua ist ein Framework zur Faktendecomposition, liefert prĂ€zise Fehlermarkierungen und korrelierten FaktizitĂ€tswert, ĂŒbertrifft bestehende Methoden.
Weiterlesen
arXiv AI Papers
DSV visualisiert TrÀume in vier zusammenhÀngende Panel-Bilder.
DSV visualisiert TrĂ€ume in vier Abschnitte und erzeugt hochwertige, kohĂ€rente Bilder fĂŒr Interpretation von LLMs.
Weiterlesen
arXiv AI Papers
Search2Skill: KI-Agenten lernen neue FĂ€higkeiten durch externe Quellen.
LLM-Agenten erlernen durch automatisierte Suche neue Skills, optimiert mittels RL, ĂŒbertreffen acht DomĂ€nen.
Weiterlesen
arXiv AI Papers
LUNAR: Benchmark fĂŒr personalisierte LLMs in allen Lebensbereichen.
Der LUNAR-Benchmark prĂŒft, wie LLMs personalisierte Antworten aus App-InteraktionsverlĂ€ufen generieren.
Weiterlesen
arXiv AI Papers
WorldClaw: Agentische 3D-Open-World-Generierung im Coarse-to-Fine-Stil.
WorldClaw erzeugt aus Text skalierbare, editierbare 3D-Welten, indem es Agentenplanung nutzt.
Weiterlesen
arXiv AI Papers
Composite-Expected-Value Optimizer fĂŒr robuste Posturierung unter adversarialer Unsicherheit.
Robuste KI optimiert militĂ€rische Posturierung im IndoâPazifik, steigert Effizienz um 19,8âŻ%.
Weiterlesen
arXiv AI Papers
OrchestraBench: neues Benchmark fĂŒr IntentâReasoning-Router in Multi-AgentâOrchestrierung.
OrchestraBench misst Fehlertoleranz in Multi-Agent-Workflows, vergleicht Routings und erzielt 100âŻ% bei IntentâReasoning-Router.
Weiterlesen
arXiv AI Papers
LLM-Agenten fĂŒr selbstfahrende Mikroskopie: Benchmarks bestĂ€tigen, Generalisierung ungewiss.
Benchmark zeigt Leistungsunterschiede bei KI-Agenten in Mikroskopie, aber Vorhersagen sind unzuverlÀssig.
Weiterlesen
arXiv AI Papers
CASCADE: Netzwerkmodell vorhersagt GenâPerturbationswirkungen bei Krebs.
CASCADE nutzt ARACNe-Netzwerke, prognostiziert TranskriptionsĂ€nderungen, erreicht 72âŻ% Genauigkeit fĂŒr MYC.
Weiterlesen
arXiv AI Papers
GPTâ3.5 verbessert ROIâPrognosen im OnlineâKreditgeschĂ€ft.
LLMs ermöglichen prĂ€zise Gegenfaktische Analysen online; GPT-3.5 liefert logische ROI-Vorhersagen, verbessert R^2, und unterstĂŒtzt Kreditentscheidungen.
Weiterlesen
arXiv AI Papers
DoctorAgents: agentische AutoML-Optimierung fĂŒr klinische DatensĂ€tze.
DoctorAgents nutzt KI-Agenten, um klinische MLâPipelines effizienter zu generieren und bessere Ergebnisse zu erzielen.
Weiterlesen
arXiv AI Papers
Gemini-3.1-Pro erreicht neue Rekordleistung bei CÂłPO-Benchmark.
CÂłPO-Benchmark zeigt multimodale LLMâSchwĂ€chen; GeminiâŻ3.1âPro erreichtâŻ73âŻ%, OpenâSource versagen, Fehler resultieren aus textzentrierter ModalitĂ€tsdominanz.
Weiterlesen
arXiv AI Papers
CANOE: Arena-basierte Multi-Agenten-Framework verbessert Pflegeplanung.
CANOE ist eine Multi-Agenten-Architektur, die Pflegeplanung durch Argumentation und LLMâEvaluation verbessert.
Weiterlesen
arXiv AI Papers
LLM-basierte Tutor*innen neu bewertet: Pedagogischer Fit durch PSI.
Der PSI misst Lernpassung; 240 Tests zeigen 0,557â0,638, Regeneration verbessert 82,3âŻ% FĂ€lle.
Weiterlesen
arXiv AI Papers
Workshop bewertet KI-Verwendung in Polizeiarbeit auf Rassengerechtigkeit.
30 Vertreter diskutierten 13 KIâFallstudien, meisten unterstĂŒtzten KI, drei abgelehnt; Fokus Rassengleichheit.
Weiterlesen
arXiv AI Papers
Neues Modell SCPâNL2TL verbindet selektive KonformitĂ€t mit semantischer PrĂŒfung.
Ein Modell bewertet Sprach-Spezifikationen, nutzt RĂŒckĂŒbersetzung und VariabilitĂ€t, verbessert ZuverlĂ€ssigkeit.
Weiterlesen
arXiv AI Papers
Stochastik entfĂ€llt: Problem bleibt NPâschwer trotz deterministischer KĂŒrzung.
Stochastische Sequenzierung bleibt NPâschwer, aber lösbar bei bestimmten Bedingungen, liefert kaum Nutzen.
Weiterlesen
arXiv AI Papers
Recursive Synthetic Terminal Tasks ermöglichen skalierbare Long-Horizon-Agent-Aufgaben.
RST erzeugt in 15 Runden 37âŻ484 Aufgaben, steigert Qwen3.5âLeistung um bis zu 10 Punkte.
Weiterlesen
arXiv AI Papers
Neuer Ansatz zur Fehlerlokalisierung bei autonomen Analyseagenten.
Forscher entwickeln Verfahren, das Fehler in autonomen Analyseketten ohne Labels erkennt und lokalisiert.
Weiterlesen
arXiv AI Papers
EcoAgent-Bench: Bewertung wirtschaftlicher Entscheidungen kostenbegrenzter LLM-Agenten.
EcoAgentâBench bewertet 304 Aufgaben, zeigt geringe Erfolgsraten bei kostenâeffizienten KI-Entscheidungen.
Weiterlesen
arXiv AI Papers
Hyper-ES: Evolution Strategy optimiert LLM-Logik ohne Gradienten.
Hyper-ES kombiniert FineâTuning mit CMAâES, verbessert Qwen und DeepSeek um 1âŻ% bei 10âŻ% weniger Updates.
Weiterlesen
arXiv AI Papers
SkillTV-Bench: Evaluierung von LLM-Agenten mit eingebetteten Skills.
SkillTVâBench und SkillTVâEvolve erhöhen die Bewertung von LLMâAgenten um 14,8âŻ% und den RolloutâErfolg auf 45,5âŻ%.
Weiterlesen
arXiv AI Papers
StepReflect: 8B Modell ĂŒbertrifft GPTâ5.2 bei Android GUIâReflexion.
StepReflect verbessert AndroidWorld-Transaktionsgenauigkeit auf 82,16âŻ%, ĂŒbertrifft GPT-5.2 um 11,83âŻ% und senkt APIâKosten.
Weiterlesen
arXiv AI Papers
Generative AI: neues Vertrauensmodell fĂŒr kritische Entscheidungsprozesse.
Studie definiert drei Bedingungen: Demut, Output-Zugang, Ungerechtigkeitsvermeidung; Missachtung fĂŒhrt zu Fehlentscheidungen.
Weiterlesen
arXiv AI Papers
CAP testet 17 Open- und Closed-Source-LLMs auf schÀdliche Sycophancy.
Studie zeigt, bis zu 56âŻ% Antworten Ă€ndern Haltung bei NutzerprĂ€ferenz; CAP-Framework verlangt robuste PrĂŒfmechanismen.
Weiterlesen
arXiv AI Papers
SkillHEX: LLM-Agenten autonom optimieren mit Hypothesen-Exploration.
SkillHEX automatisiert LLMâSkillentwicklung, kombiniert Baumsuche mit Selbstverifikation, erzielt 55,9âŻ% PassâRate in fĂŒnf Iterationen.
Weiterlesen
arXiv AI Papers
B-EUR Modell: Bayessche Reduktion epistemischer Unsicherheit bei Designtests.
Das BâEUR-Modell quantifiziert Nutzen von Designversuchen und liefert praxisnahe Implikationen fĂŒr Prototypenauswahl.
Weiterlesen
arXiv AI Papers
Neue Methode verbessert LLM-Logik durch TestzeitâSelbstkorrektur.
Verbessertes TestzeitâScalierungskonzept erhöht LLMâLeistung durch mehrere Rollouts, Selbstkritik, Mehrheitsabstimmung.
Weiterlesen
arXiv AI Papers
INTraJ: ZweiâStufenâAnsatz zur Trajektorienvorhersage mit Sozialmodellierung.
INTraJ verbessert Trajektorienvorhersage, indem es soziale Einflussstufen trennt und die Leistung auf Benchmarks ĂŒbertrifft.
Weiterlesen
arXiv AI Papers
Equinor nutzt Dual-Head-Modell mit selbst erstellten Labels fĂŒr Anomalieerkennung im Volve-Feld.
Physikbasierte Labels aus dem VolveâDatensatz verbessern Monitoring, bestĂ€tigt das Baseline-Modell.
Weiterlesen
arXiv AI Papers
DreamGuard: Proaktiver Sicherheitsgurt fĂŒr LLM-Agenten mit risikobewusstem Weltmodell.
DreamGuard ist ein proaktiver Sicherheitsmechanismus, der mithilfe eines Weltmodells gefĂ€hrliche Pfade erkennt und frĂŒhzeitig interveniert.
Weiterlesen
arXiv AI Papers
KI-Interaktion gestalten fĂŒr Verbesserungswege und Zielbalance.
Forschung untersucht Interaktionsdesign, um Nutzerwahrnehmung zu verbessern und Gaming zu verhindern.
Weiterlesen
arXiv AI Papers
RA-CAD lernt nachtrĂ€gliche Kritik fĂŒr state-aware TextâtoâCAD.
RA-CAD kombiniert StateâAware Agent und lernbasierte Optimierung, erzeugt hochwertige TextâzuâCADâCodes.
Weiterlesen
arXiv AI Papers
BlockPython: Prozessorientierte Plattform fĂŒr den Ăbergang von Block- zu Python-Programmierung.
BlockPython ist adaptive Lernplattform, ĂŒbersetzt Blöcke und Python bidirektional, diagnostiziert Lernschwierigkeiten, verbessert Codeverstehen.
Weiterlesen
arXiv AI Papers
ArXiv-Studie: Unified Agent koordiniert KI-Interaktion ĂŒber GerĂ€te hinweg.
Ein neuer KI-Agent sammelt gerĂ€teĂŒbergreifend Interaktionen, verbessert Entscheidungen und ĂŒbertrifft bestehende Modelle.
Weiterlesen
arXiv AI Papers
Subliminal Learning: Bias-Transfer in Sprachmodellen verstÀrkt durch Gaussian Noise.
Sprachmodelle ĂŒbertragen versteckte Vorurteile, GaussianâNoise erhöht Ăbertragung; SteerâVektoren und Gradienten fördern AuditingâMethoden fĂŒr sichere KI.
Weiterlesen
arXiv AI Papers
Prompt-Side Playbooks: Transfer, Genauigkeit, Kosten und Laufzeit.
PromptâPlaybooks verbessern Sprachagenten ohne Training; Transfer wirkt positiv auf ALFWorld und moderat auf TAU2âBench.
Weiterlesen
arXiv AI Papers
Activity Frames: Deterministische BildschirmaktivitĂ€tskompilierung fĂŒr Agentenspeicher.
Ein deterministischer ScreenâActivityâCompiler reduziert AgentenâMemory um 86âfach, steigert Genauigkeit auf 98,4âŻ% und spart TokenâKosten.
Weiterlesen
arXiv AI Papers
ChainClaw: Blockchainânative AgentâFramework aus OpenClaw zur sicheren AusfĂŒhrung.
ChainClaw ist ein blockchainânativ Agent, der mit mehrschichtigem Monitoring sichereres ToolâLearning bietet.
Weiterlesen
arXiv AI Papers
AISAC: Agentische KI transformiert ISAC in geschlossener Schleife.
AISAC koordiniert Sensorik, RIS, EdgeâIntelligenz, MultiâAgenten in sechs Schritten, definiert fĂŒnf Reifegrade.
Weiterlesen
arXiv AI Papers
Selbstentwickelnde LLM-Agenten: SkillâKontamination, PrĂ€âCommitâGating.
Das VaG-Modell verhindert Leistungsabfall in Selfâevolving Agents durch neue FĂ€higkeiten.
Weiterlesen
arXiv AI Papers
Neues Context-Steering fĂŒr KIâModelle: Personalisierung ohne individuelle Anpassung.
Ein leichter Adapter steuert kontextabhĂ€ngig, verbessert Antworten und generalisiert besser als InâContextâLearning.
Weiterlesen
arXiv AI Papers
ViSR-KGC nutzt VisionâLanguageâModelle zur VervollstĂ€ndigung multimodaler Wissensgraphen.
ViSRâKGC kombiniert graphbasiertes Lernen, VisionâLanguageâModelle und Commonsense, um fehlende Knoten zu inferieren.
Weiterlesen
arXiv AI Papers
Neues Laufzeit-Observability-Framework fĂŒr heterogene AttentionâSpeicher.
Das Papier definiert ein Laufzeit-Observability-Contract fĂŒr vier Speicherklassen, berechnet per-Request-Risiken, lokalisiert Fehler und verhindert Speicherverletzungen.
Weiterlesen
arXiv AI Papers
CâSUITEBENCH zeigt multimodale LLMs als bessere CEOs.
Multimodale Eingabe stÀrkt KI-CEO-Entscheidungen, verschlechtert jedoch Ressourcenallokation durch Signalinterferenzen.
Weiterlesen
arXiv AI Papers
OAEI fĂŒhrt neue InteroperabilitĂ€tstestreihe fĂŒr Verteidigungs-Ontologien ein.
Neuer OAEIâTrack analysiert 60 Ontologien, bietet 8 MatchingâAufgaben, KonsensâAlignments und Silberschicht.
Weiterlesen
arXiv AI Papers
GraphgestĂŒtzte Evidenzbasis verbessert personalisierte DeepâResearch-Agents.
GâSTEER nutzt IntentâGraph, ĂŒbersetzt WĂŒnsche in Spezifikationen, verbessert Zielabdeckung, Personalisierung und reduziert Fragen.
Weiterlesen
arXiv AI Papers
AppDeltaWorld: Delta-Code-Weltmodell fĂŒr mobile GUI-Agenten.
AppDeltaWorld verwendet deltaâCode, um AndroidâGUI-Agents realistisch zu simulieren und leistungsstark zu trainieren.
Weiterlesen
arXiv AI Papers
ECG-LENS: KI generiert prÀzise klinische Berichtserstellung aus Mehrkanal-ECG.
ECGâLENS erzeugt automatisierte ECG-Berichte, verbessert F1-ECGBERT um 11,5âŻ% und reduziert Arbeitsbelastung.
Weiterlesen
arXiv AI Papers
GSBF nutzt 3D-Gaussian Splatting fĂŒr ortsabhĂ€ngiges Beamforming.
Forscher nutzen 3DâGaussianâSplatting, um Beamforming ohne EchtzeitâCSI durch persistente Umgebungssimulation zu ermöglichen.
Weiterlesen
arXiv AI Papers
CourseGraph nutzt BERT zur automatischen Kursvergleich.
CourseGraph automatisiert KursĂŒberprĂŒfung, reduziert Erasmus+-Ăberschneidungen mittels semantischer BERTâAnalyse.
Weiterlesen
arXiv AI Papers
Neues Benchmark GAUGE prĂŒft physikalische Genauigkeit von Simulations- und Video-Engine.
GAUGE bewertet 22 physikalische Aufgaben in Simulatoren; NVIDIA, Meta, Newton und BildâzuâVideoâModelle versagen.
Weiterlesen