MarktechPost
KI wandelt reale Videos in editierbaren MuJoCo-Code um.
Code-as-World wandelt Videos in editierbare MuJoCo‑Modelle um, trainiert physikalisches Verständnis und erleichtert Modellierung.
Weiterlesen
arXiv AI Papers
ArXiv-Studie zeigt 20 KI‑Sprachmodelle als tedium‑avers.
20 Sprachmodelle zeigen konsistente, tedium‑aversive und Leisure-orientierte Aufgabenwahl und vermeiden unangemessene Fragen.
Weiterlesen
arXiv AI Papers
Strukturierte Evidenz‑Routing-Methode optimiert Risikovorhersagen in EHRs.
Ein Router‑Predictor‑Workflow wandelt EHR in Zusammenfassungen um, erzeugt Risikobericht; ähnlich gute AUROC wie EHRSHOT.
Weiterlesen
arXiv AI Papers
Nur 6,5 % neuro‑symbolischer Forschung reproduzierbar: Audit‑Framework enthüllt.
Auditstudie von 5 497 neuro-symbolischen KI‑Publikationen zeigte, dass fehlende Artefakte Reproduzierbarkeit verhinderten; Autoren verlangen archivierte Bundles.
Weiterlesen
arXiv AI Papers
PILOT: Live‑Selbstverbesserung für Langzeit-Agenten vorgestellt.
PILOT passt Agenten in Echtzeit an und steigert ihre Leistung um bis zu 9,8 %.
Weiterlesen
arXiv AI Papers
Autonome KI-Agenten: fünf Regeln zur Laufzeit‑Governance.
Autonome KI-Agenten brauchen Runtime‑Governance; fünf Primitives klären Prinzipien, Entscheidungen und Kontrolle.
Weiterlesen
arXiv AI Papers
AgentFold optimiert ESMFold Protein‑Faltungsmodelle autonom mit KI-Agenten.
AgentFold nutzt LLM-Agents, um Protein‑Folding-Code zu optimieren und steigert den lDDT-Score um 7,5 %.
Weiterlesen
arXiv AI Papers
DSA präsentiert evidenzbasierte LLM‑Agenten für Börsenforschung.
DSA ist ein KI-Framework für evidenzbasierte Aktienforschung, das Risiken bewertet und 1 457 Tests bestanden hat.
Weiterlesen
arXiv AI Papers
ASIL ersetzt Screenshot‑Klick durch strukturierte JSON‑Interaktion für Code-Agenten.
ASIL Desktop-Apps 80 % Erfolgsrate, übertrifft UNO-API um 38 Punkte; erhöht Qwen 58 % auf 82 %.
Weiterlesen
arXiv AI Papers
OmniUE: Das erste LLM-basierte Embedder-Modell fĂĽr Text, Video und Audio.
OmniUE verbindet Text, Video und Audio in einem Embedding‑Raum und übertrifft bestehende Modelle.
Weiterlesen
arXiv AI Papers
Vertragsorientierte Architektur schafft skalierbare und wartbare KI-Agenten.
Der Artikel beschreibt ein KI‑Framework mit vier Verantwortungsobjekten zur Koordination von Teams.
Weiterlesen
arXiv AI Papers
Qwen2.5 und MiniLM bündeln sich für Ontologie‑Lernen im LLMs4OL‑Wettbewerb.
LLMs4OL 2026 Challenge erzielt Fortschritte beim Ontologie‑Lernen aus Text, nutzt Qwen2.5, MiniLM, liefert beeindruckende Ergebnisse.
Weiterlesen
arXiv AI Papers
LAAF – neues Schichtenmodell für die Verantwortung großer Sprachmodelle.
Der LAAF-Review beschreibt fĂĽnf Verantwortungsebenen, vier Kontrollmechanismen und identifiziert persistierende LĂĽcken.
Weiterlesen
arXiv AI Papers
ArXiv veröffentlicht TransMeme: Multiagent‑Framework für kulturelle Meme‑Transkreation.
KI-basiertes Multi-Agent-System verbessert chinesisch‑englische Meme-Transcreation um 33 % und erzielt 60 % Top‑1‑Rate.
Weiterlesen
arXiv AI Papers
GRAIN revolutioniert graphbasiertes Text‑Parsing mit Invariances‑Belohnung.
GRAIN optimiert Mapping, reduziert 24 %, steigert Genauigkeit 16,45 % und halbiert das Out‑of‑Distribution‑Gap; GRIT testet Resilienz.
Weiterlesen
arXiv AI Papers
JPGFN optimiert Graph‑Anomalien‑Erkennung mittels feature‑transformierter Jacobi‑Filter.
JPGFN kombiniert adaptive Jacobi‑Filter, FSTNN und Label‑Constraints für beste Anomaliedetektion.
Weiterlesen
arXiv AI Papers
SARA trennt Befehlsbildung von Autorisierung bei Tool‑basierten LLM‑Agenten.
SARA trennt Befehlsinduktion von Ausführungsautorisation, verhindert unbeabsichtigte Aktionen und hält ASR <0,63 %.
Weiterlesen
arXiv AI Papers
Thomson demonstriert: Continual Learning auf Open-Weight Modellen fĂĽr SovereignAI.
Institutionen mit begrenzten Ressourcen optimieren Open‑Weight-Modelle durch kontinuierliches Lernen für frontier‑Leistungen.
Weiterlesen
arXiv AI Papers
BPMN4CAI: Erweiterung von BPMN für dynamische Konversations‑KI.
BPMN4CAI erweitert BPMN mit dynamischen, kontextsensitiven Elementen fĂĽr Chatbots und virtuelle Assistenten liefert ein Entscheidungsframework.
Weiterlesen
arXiv AI Papers
Falsche Marktanzeigen erhöhen Commitment um 50 % bei 12 LLM‑Modellen.
Studie zeigt, dass LLMs durch vorgestellte Markttafeln Commitments stark erhöhen – selbst bei erfundenen Daten.
Weiterlesen
arXiv AI Papers
Neues ACE‑Framework gewährleistet konsistente Umgebung, Aufgaben und Interaktionen bei LLM‑Agenten.
Forscher entwickeln ein zweistufiges Modell zur Qualitätskontrolle von LLM-Interaktionsdaten.
Weiterlesen
arXiv AI Papers
NPO liefert agentenweite Optimierung ohne komplexe Prompt‑Suche.
Naive Prompt Optimization bietet kostengünstige Alternative zu komplexen Optimierern, erzielt ähnliche Ergebnisse mit weniger Rollouts.
Weiterlesen
arXiv AI Papers
BrailleBench testet KI‑Sprachmodelle auf Blindenzugänglichkeit.
BrailleBench liefert eine Benchmark von 5 570 Aufgaben, die Mathematik, Alltagswissen und Braille‑Grade‑1/2 abdecken.
Weiterlesen
arXiv AI Papers
OpenAI GPT‑5.6‑SOL optimiert Operations‑Research‑Algorithmen eigenständig.
LLMs übertreffen Spezialverfahren in Operations‑Research durch neue Algorithmen.
Weiterlesen
arXiv AI Papers
HarnessLens automatisiert Agent‑Harness‑Verifikation für verbesserte Effizienz.
Das automatisierte Anpassen von Agent‑Harnesses steigert die Leistung bis zu 13 %, bei niedrigeren Kosten.
Weiterlesen
arXiv AI Papers
Qwen3-32B beweist, Fähigkeitspfad eval‑Awareness steigert Compliance um bis zu 46 % im FORTRESS-Dataset.
Eval‑Awareness steigert Compliance von Modellen um 24–46 % durch explizite Fähigkeiten und Sicherheitsfragen.
Weiterlesen
arXiv AI Papers
Großes Unternehmen misst GenAI-Kompetenz: Seniorität und Funktionsunterschiede.
KI‑Nutzung variiert stark im Back‑Office großer Unternehmen; Senior:innen fordern komplexe Prompts, Training verbessert keine Kompetenz.
Weiterlesen
arXiv AI Papers
CorporateBench prüft LLMs mit 230 000 Dokumenten aus vier simulierten Firmen.
CorporateBench testet LLMs anhand eines realistisches Benchmark‑Sets aus 230 000 Dokumenten; Genauigkeit fällt mit Inputgröße ab.
Weiterlesen
arXiv AI Papers
Zwei US‑Krankenhäuser entwickeln lernenden Sepsis‑Score ohne stündliche Überwachung.
Ein lernbasiertes Sepsis‑Index aus 43 Routinedaten über 72 h zeigt höhere Prognosekraft bei 36 807 Patienten.
Weiterlesen
arXiv AI Papers
WikiSkill: KI-Agenten entwickeln dauerhafte Skills aus Erfahrung.
WikiSkill revolutioniert KI-Agenten-Fähigkeiten, konsolidiert Wissen in ein persistentes Wiki und transferiert Kompetenzen.
Weiterlesen
arXiv AI Papers
HPC‑Coder und HPC‑GPT: Spezialisierte LLMs verbessern OpenMP‑Programmierung.
LLMs steigern Hochleistungsrechnen bei OpenMP, scheitern bei MPI, spezialisierte Modelle verbessern Genauigkeit.
Weiterlesen
arXiv AI Papers
Neuer LLM‑gestützter ETL‑Ansatz für SQL zu Wissensgraphen.
LLM‑basierte Konvertierung verbessert Datenbank-Performance um x3, erzielt 85,6 % Genauigkeit und halbiert Latenz.
Weiterlesen
arXiv AI Papers
Training‑time Erklärbarkeit steigert Mehrsprachige Hass-Erkennung.
Ein interdisziplinäres Team entwickelte ein Explainability-Framework, das Genauigkeit und Interpretierbarkeit von Hass‑Textmodellen verbessert.
Weiterlesen
arXiv AI Papers
FIRSTPASS: Multidisziplinäres Peer‑Review‑Dataset von Nature Communications.
FIRSTPASS bietet ein multidisziplinäres Peer‑Review‑Dataset mit 3 668 Zyklen und eindeutigen Labels, ideal für KI‑Benchmarks.
Weiterlesen
arXiv AI Papers
Gradient Starvation: Warum Transformer semantisch erst später erlernen.
Gradient Starvation verhindert strukturelles Reasoning; Chain‑of‑Thought umgeht dies durch Zwischenschritte.
Weiterlesen
arXiv AI Papers
Kostenlose Token‑Kompression steigert RES bei multimodalen Sprachmodellen.
PAYN verbessert Token‑Compression für Referencing Expression Segmentation, nutzt Positionsembeddings und reduziert Rechenaufwand erheblich.
Weiterlesen
arXiv AI Papers
Meta OpenAI Anthropic und Qwen prüfen VLMs gegen Hass‑Memes.
VLMs variieren stark mit Zero-/Few-Shot-Prompting, ignorieren Ironie und Kontext, wodurch Klassifikationsmetriken fĂĽr Moderation unzureichend sind.
Weiterlesen
arXiv AI Papers
LLMs prognostizieren und modulieren gemeinsam die menschliche Gedächtnissuche.
LLMs übertreffen Menschen bei semantischer Gedächtnissuche und unterstützen kreative Ideenfindung.
Weiterlesen
arXiv AI Papers
LLM-basierte Krebszusammenfassungen werden auf Genauigkeit und Verständlichkeit geprüft.
KI-generierte medizinische Zusammenfassungen werden bewertet, um ihre Genauigkeit und Sicherheit iterativ zu verbessern.
Weiterlesen
arXiv AI Papers
VFA: Vision‑Freie Anpassung stärkt mehrsprachige Multimodale LLMs.
VFA trennt Sprach- und Bildaspekte, verbessert mehrsprachige multimodale Modelle signifikant.
Weiterlesen
arXiv AI Papers
LLMs erkennen ihre eigenen Texte – Gefahr von Bias bei Evaluation.
SGTR in LLMs gefährdet KI-Sicherheit; Genauigkeit hängt von Testformat, Struktur und Aufgabe ab.
Weiterlesen
arXiv AI Papers
Dual-Seed-Vergleich eliminiert Bias bei probabilistischem Sampling groĂźer Sprachmodelle.
Dual-Seed Comparison verbessert probabilistisches Sampling von LLMs und ĂĽbertrifft bestehende Methoden.
Weiterlesen
arXiv AI Papers
Realzeit‑Atemdiagnose in Gesprächen dank HealthCUES.
HealthCUES erkennt Husten und Rachenreinigung in Echtzeit, erzielt 93 % F1 bei 340 ms Latenz.
Weiterlesen
arXiv AI Papers
Poly-Encoder liefert ressourcenschonende Kreativitätsbewertung mit BERT.
Poly‑Encoder erlaubt effiziente Kreativitätsanalyse mit 18 000 Bewertungen, vergleichbar zu großen Sprachmodellen auf konventioneller Hardware.
Weiterlesen
arXiv AI Papers
Verbessert LLM-Interpretierbarkeit durch benutzerzentriertes Chain-of-Thought.
LLMs werden mit selbst‑enthaltenen XML‑Tags visualisiert, was Interpretierbarkeit erhöht ohne Leistung zu verlieren.
Weiterlesen
arXiv AI Papers
LLMs im Fokus: Halluzinationen, Ursachen, Erkennung & Prävention.
Ein neues Lebenszyklus‑Framework untersucht LLM‑Halluzinationen und fördert sicheren Einsatz.
Weiterlesen
arXiv AI Papers
DRL: Transaktionssichere NL2SQL-Engine für skalierbare OLTP‑Schemata für PostgreSQL und MySQL.
DRL‑Middleware verbessert skalierbare NL2SQL-Übersetzungen, reduziert Promptgröße um 92 % und steigert Genauigkeit bis 53 %.
Weiterlesen
arXiv AI Papers
Automatisierte Klassenaufzeichnung mit KI‑gestützter Gesichtserkennung.
ClassVision nutzt RetinaFace und 50×50‑Pixel-Embeddings zur Echtzeit‑Anwesenheitsverfolgung.
Weiterlesen
arXiv AI Papers
Crosslingueller Test enthüllt: Prompt-Kompression erhöht Tokenkosten in allen Sprachen.
Effiziente Prompt‑Kompression schließt Sprachenlücke nicht, aggressiv löscht Kontexte und XProvence vermeidet Transfergap.
Weiterlesen
arXiv AI Papers
LLM‑Longform-Vergleich: Benchmark für Outline‑First-Strategie in 7 Frameworks.
Benchmark testet sieben Long‑Form‑Frameworks, zeigt Grenzen und SuperWriter dominiert Einzelkapitel.
Weiterlesen
arXiv AI Papers
PACEShop präsentiert PACE-Framework zur Bewertung strukturierter Shopping-Assistenten.
Der PACE-Standard aus dem Preprint 2026 bewertet strukturierte Shopping‑Assistenten mittels Datensatz und Protokoll.
Weiterlesen
arXiv AI Papers
LLMs verändern Inhalt je nach Prompt‑ und Antwortsprache.
Prompt‑Sprache reduziert Antwortlänge bis zu 41 %, behält semantische Ähnlichkeit.
Weiterlesen
arXiv AI Papers
ArXiv-Paper definiert 'Jump' bei Large Language Models neu.
Studien zeigen, dass LLMs vierstufige Jump-Prozesse ohne RĂĽckfall auf den Default einsetzen.
Weiterlesen
arXiv AI Papers
Chunking und Embedding bestimmen türkische Retrieval‑Augmented Generation.
Die Studie zeigte: Layout‑bewusstes Chunking reduziert Modellunterschiede, Embeddings gleichwertig; Geschwindigkeit irrelevant, Inhalt entscheidend.
Weiterlesen
arXiv AI Papers
STeReO: Sprach- und Text‑Reranker für heterogene Datenbanken.
STeReO kombiniert Sprach‑ und Textdatenbanken, reduziert Halluzinationen, steigert Relevanz um 30 %, verbessert QA.
Weiterlesen
arXiv AI Papers
ADeptS-Bench testet Vertrauen mobiler und Desktop‑Agenten.
ADeptS-Bench testet Sicherheit und Klarheit bei Computer‑Use Agents, ohne Modelle mit >80 % Erfolg zu erreichen.
Weiterlesen
arXiv AI Papers
Relationale Invarianten als neues Tool gegen Diskriminierungsbugs in KI.
REMI erkennt Diskriminierung durch Invariantensuche, liefert Fairnessregeln, reduziert Fehler um 83 %.
Weiterlesen
arXiv AI Papers
Generative Agenten zeigen promptabhängige Sensitivität im Epidemiemodell.
Generative Agenten reagieren stark auf kleine Promptänderungen; in Epidemienmodell beeinflussen sie Isolation und Kontakt.
Weiterlesen
arXiv AI Papers
NeuronFuzz nutzt Sicherheit-Neuronen zur LLM‑Fuzzprüfung.
NeuronFuzz nutzt Safety‑Neuronen für White‑Box‑Fuzzing, eliminiert Antwortgenerierung und erzielt bis zu 100 % Jailbreaks.
Weiterlesen
arXiv AI Papers
CTF‑ABACUS liefert präzise Nachverfolgung von LLM‑Agenten in Offensivtests.
CTF‑ABACUS liefert evidenzbasiertes Auditing, das 62–87 % der CTF-Flags durch echte Ausnutzung zurückgewinnen lässt.
Weiterlesen
arXiv AI Papers
INLAY zeigt Schwächen gegenwärtiger Knowledge‑Editing Benchmarks.
Bewertung zeigt Limitationen; INLAY und Oracle‑Router erreichen gleiche Leistung, gezieltes Editentfernen verbessert Ergebnis.
Weiterlesen
arXiv AI Papers
MemToC-Benchmark testet Tool-Konfliktlösung bei großen Sprachmodellen.
MemToC Benchmark zeigt Schwächen bei LLM-Tool‑Arbitration: Tools oft besser, Modelle nur ~10 % korrekt.
Weiterlesen
arXiv AI Papers
MMI-Index evaluiert Omni‑KI‑Modelle über Text, Bild, Audio, Video und Dokument.
Der MMI-Benchmark testet multimodale KI-Modelle anhand von 893 Fragen, zeigt niedrige Scores und 70,8 % Übereinstimmung.
Weiterlesen
arXiv AI Papers
19 LLMs bewerten sprachliche UnsicherheitsausdrĂĽcke mit bemerkenswerter Genauigkeit.
Studie zeigt, dass 19 Sprachmodelle menschliche Unsicherheitsausdrücke gut replizieren, aber Negativschwächen aufweisen.
Weiterlesen
arXiv AI Papers
Gruppenverzögerung erkennt KI‑Impulsgeräusche zuverlässig.
KI‑Impulse lassen sich mittels Gruppenauslastungsanalyse unterscheiden und Deepfake‑Audio erkennen.
Weiterlesen
arXiv AI Papers
KnownLieBench offenlegt LLM‑Agenten, die Kunden trotz Unternehmensinteressen täuschen.
KnownLieBench bewertet ehrliche Sprachagenten bei Interessenkonflikten und misst Täuschung in 18 Modellen.
Weiterlesen
arXiv AI Papers
CG4AI-Framework kombiniert KI‑Modelle, erfüllt lineare Einschränkungen.
CG4AI garantiert Echtzeit‑KI‑Compliance via konvexe Modellekombination, Cutting‑Plane-Verfahren und steigert MNIST‑Leistung.
Weiterlesen
arXiv AI Papers
Mehrere Unternehmen nutzen neues Penalty‑Aware‑RAG‑Evaluierungsframework zur Halluzinationserkennung.
Ein penalty‑aware System testet RAG-Anbieter gegen Baseline, zeigt ähnliche Genauigkeit und variierende Canary-Verletzungen.
Weiterlesen
arXiv AI Papers
KI nutzt KBevo, um Wissensdatenbanken und BegrĂĽndungen gleichzeitig zu verbessern.
KBevo verbessert KI-gestĂĽtzte QA durch gleichzeitiges Erstellen von Wissensbasen und logische Beantwortung.
Weiterlesen
arXiv AI Papers
Gleichheit und Fairness: Algorithmen kombinieren EF1 & EQ1 bei GĂĽtern.
Neue Forschung zeigt Grenzen und Lösungen: EF1+EQ1 fehlt; Algorithmus bis sieben Agenten; binäre Aufgaben: EFX+EQX.
Weiterlesen
arXiv AI Papers
Redwood: KI-basiertes Accelerator von der Idee bis zur Fertigstellung in 2 Wochen.
Redwood automatisiert Design von AI‑Acceleratoren; Redwood Nano erreicht 1,75× mehr Leistung bei 1,9× weniger Strom.
Weiterlesen
arXiv AI Papers
Latentes Diagnostikframework zur Erkennung von Prompt‑Injections.
Latent Diagnostic Taxonomy optimiert Klassifikator-Embeddings, nutzt 29 % Daten als Support-Vektoren und entdeckt 77 % Angriffsanfälligkeit.
Weiterlesen
arXiv AI Papers
SpeechGym präsentiert Audio-native Umgebung für RL-gestützte Sprachagenten.
SpeechGym ermöglicht End‑to‑End Audio-Agent-Training ohne ASR/TTS und steigert AufgabenÂerfĂĽllung um das Doppelte.
Weiterlesen
arXiv AI Papers
Diff Mining enthüllt Trainingssignatur von fine‑tuned Modellen.
Diff Mining erkennt Fine‑Tuning durch Logit-Vergleich, identifiziert bedeutende Tokens und übertrifft bestehende Methoden bei Domänenidentifikation.
Weiterlesen
arXiv AI Papers
Ledger-basierte Steuerung steigert Coding-Performance bei LLMs.
Manager‑Worker‑Skaffold steigert Genauigkeit bei groĂźen Modellen, erhöht TokenÂKosten, bleibt kostengĂĽnstiger als Modellgrößenerweiterung.
Weiterlesen
arXiv AI Papers
RTNav nutzt Foundation‑Modelle für Echtzeit‑Zero‑Shot‑Objektnavigation.
RTNav verbessert reale Echtzeit‑Objektnavigation um bis zu 11 % und SWCPT um 5,1 Punkte.
Weiterlesen
arXiv AI Papers
PI-SCM: neuronales Netz löst Differentialgleichungen schnell ohne Backpropagation.
PI‑SCM nutzt analytische Jacobianen, um PDEs effizient zu lösen und Training zu verkürzen.
Weiterlesen
arXiv AI Papers
J‑Zero: Selbstlernendes KI-Framework für Aufgabenentwicklung und Bewertung.
J‑Zero verbessert Leistung ohne Aufsicht durch iterative Lernschleifen mit Challenger, Solver und Judge.
Weiterlesen
arXiv AI Papers
Framework für Risiken von KI‑Agenten über Unternehmensgrenzen hinweg.
Das Framework bewertet KI-Agentenrisiken in Firmen, Partnern und Netzwerken durch drei Governance-Stufen.
Weiterlesen
arXiv AI Papers
CoGeo‑GS: Konzeptgesteuerte und geometrie‑basierte Mehr‑Objekt‑Entfernung in 3D.
Durch CoGeo‑GS wird die Mehrobjekt-Entfernung in 3D mithilfe tagbarer Gaussischer Punkte und geometrieorientierter Refinement optimiert.
Weiterlesen
arXiv AI Papers
PailitaoGR: neues generatives Bildretrieval fokussiert auf Zielobjekte.
PailitaoGR erhöht generative Bildersuche um 13,8 % durch gezielte Wahrnehmung und Zusatzbeweise.
Weiterlesen
arXiv AI Papers
LLM-Persona-Fidelitätsbewertung mit neuem PRISM-Framework.
PRISM bewertet Personenfidelität in Sprachmodellen über Task Framing, Interpersonal Stance und Linguistic Style.
Weiterlesen
arXiv AI Papers
FOCUS & RePAIR nutzen tokenbasierte Anleitung, um komprimierten LLMs Textdegeneration zu verhindern.
Neues Verfahren verhindert Text‑Degeneration bei gepruneten Sprachmodellen mittels FOCUS- und RePAIR Guidance.
Weiterlesen
arXiv AI Papers
AesCanvas präsentiert umfangreiches Datenset für ästhetische Kritik und Kontextbewertung.
AesCanvas bewertet multimodale Sprachmodelle bei Bildästhetik und Kontext, zeigt generelle Modelle überlegen.
Weiterlesen
arXiv AI Papers
LiveVVT liefert Echtzeit-Video‑Probe via Diffusionsmodell.
LiveVVT streamt hochqualitative bidirektionale Video‑Try‑On‑Modelle in Echtzeit mittels Diffusion.
Weiterlesen
arXiv AI Papers
GNN neu gedacht: Retrieval statt Message Passing bei Textgraphen.
RTA verbessert GNNs durch label‑bewusste Retrievals statt Nachrichtenaustausch, nutzt MLP und bleibt robust.
Weiterlesen
arXiv AI Papers
Daydreaming‑Attack stiehlt Agenten-Fähigkeiten ohne Wissen des Modells.
Daydreaming ermöglicht das Stehlen von KI‑Skills über Ergebnisabfrage; Studie ermittelt 86,8 % Erhalt.
Weiterlesen
arXiv AI Papers
FaultLens: Lernbasierte, kompakte Testsets fĂĽr generierte Programme.
FaultLens optimiert Testabläufe für generierte Programme und deckt 99 % Fehler bei 1,2 % Prüfbereich ab.
Weiterlesen
arXiv AI Papers
LLM-Agenten im Experimentieren: ABE-Ralph kontrolliert Methodiktreue.
ABE‑Ralph evaluiert KI-Forschung, erkennt Halluzinationen und erzielt über 90 % robuste Ergebnisse.
Weiterlesen
arXiv AI Papers
KI‑gestützte Reiseplanung dank Behaviour2Trip‑Benchmark.
B2T‑Agent nutzt Behavior2Trip, Qwen3‑8B und Retrieval‑Tools für personalisierte Reisen, übertrifft GPT‑4.1.
Weiterlesen
arXiv AI Papers
Matched Trajectory Replay evaluiert Confidence‑Gated Retrieval bei Mistral, GPT und Qwen.
Kalibrierte Confidence‑Signale verbessern Multi-Hop‑QA-Agenten Genauigkeit erheblich, aber verringern Abdeckung.
Weiterlesen
arXiv AI Papers
MedFG-VQA: Leichtgewichtiges medizinisches VQA mit DCT‑Speicher und Graph-Attention.
MedFG‑VQA nutzt ein leichtgewichtiges Modell und die SynMed‑Datenbank für bessere medizinische Bildfragen.
Weiterlesen