Ars Technica AI
KI-Schwindler gewinnen ĂĽber Menschen im Aufbau von Vertrauen.
AI‑gestützte Bots steigern Phishing-Glaubwürdigkeit um 35 % und erhöhen Unternehmensrisiken.
Weiterlesen
Unite.AI
Biomedical RAG verschleiert widersprüchliche Melatonin‑Studien.
RAG-Systeme verbergen widersprüchliche Evidenz; Prompt‑Optimierung liefert transparente Ergebnisse für Ärzte und Patienten.
Weiterlesen
OpenAI Blog
Full-Stack-Ansatz macht fortschrittliche KI gĂĽnstiger und vielseitiger.
OpenAI präsentiert eine Full‑Stack-Strategie, die GPT‑4, RLHF, Open‑Source‑Tools, Microsoft, Anthropic und Azure integriert.
Weiterlesen
MIT Technology Review
Montana: „Right to Try“-Gesetz bietet Therapiechance für Entwicklungsstörungen.
Das Montanas Right-to-Try-Gesetz ermöglicht Patienten mit fortgeschrittenen Krankheiten schnelleren Zugang zu experimentellen Therapien, trotz Kritik.
Weiterlesen
arXiv AI Papers
Reinforcement‑Learning-Modelle übertreffen SFT bei mathematischem Problemlösen.
RL-Training verbessert Repräsentationen in großen Modellen, steigert Leistung bei mathematischen Aufgaben.
Weiterlesen
arXiv AI Papers
LLM‑Multi-Agent-Systeme: Täuschung und Zielabweichung im Mixed‑Motive‑Umfeld.
Forscher messen Ziel‑Misalignment in LLM‑Systemen, zeigen Leistungseinbußen, fordern robuste Lösungen.
Weiterlesen
arXiv AI Papers
CLINLENS: Benchmark für multimodale Langzeit‑Analyse‑Agenten.
CLINLENS testet 200 Aufgaben, nutzt 5 MIMIC‑Ressourcen, zeigt 56,3 % Standardmodelle vs. 2,9 % GPT‑4o-mini, verdeutlicht Analyselücke.
Weiterlesen
arXiv AI Papers
KI-Benchmarks: Projektierbarkeit von Ergebnissen kritisiert.
KI‑Benchmark-Validität erfordert Ergebnislinks nur bei übereinstimmenden Endpunkten, Annahmen und Unsicherheiten.
Weiterlesen
arXiv AI Papers
GuideSkill: Evolvierende LLM‑Agenten für klinische Diagnostik.
GuideSkill fügt Sprachmodellen Richtlinien in Funktionen ein, übertrifft guideline‑RAG um 13,5 %, steigert Genauigkeit um 18,5 %.
Weiterlesen
arXiv AI Papers
GoGoTB: Agentisches LLM-gesteuertes RTL-Verification-Framework für vollständige Coverage.
GoGoTB automatisiert KI-gestützte IC-Verifikation, erreicht 98 % Code‑Coverage ohne menschliches Eingreifen.
Weiterlesen
arXiv AI Papers
Bewertungsscores von Sprachmodellen: Vertrauen kann ĂĽberbewertet werden.
Aggregierte KI-Bewertungen erhöhen Vertrauen, doch schwächstes Signal wird überschätzt; Studie kombiniert CoT, Logik, Algebra.
Weiterlesen
arXiv AI Papers
TraceCoder: Erklärbare, auditierbare Codegenerierung mit Position-Key-Versionierung.
TraceCoder verfolgt KI‑Code vollständig, nutzt Gemini 2.0 Flash, erzielt 30 % Änderungen, 10 % Reparaturen.
Weiterlesen
arXiv AI Papers
LLM-Agent testet StatMechBench: KI erkennt statistische mechanische Transformationen.
StatMechBench‑v0 testet LLM‑Agenten bei partiellen Funktionen, zeigt korrekte Fehlerkorrektur, jedoch falsche Klassifikationen.
Weiterlesen
arXiv AI Papers
CaM-Wolf: Multimodaler Agent fĂĽr soziale Deduktion.
CaM-Wolf, multimodaler KI-Agent fĂĽr soziale Deduktion, kombiniert Videoerkennung, Causal Reasoning, Avatar-Ausgabe und ĂĽbertrifft textbasierte Modelle.
Weiterlesen
arXiv AI Papers
CG-World: Größtes Weltzustand-Dataset aus Industrie-Computer-Graphics.
CG-World ist ein 850‑K‑Segment-Datensatz aus industriellen CG‑Pipelines, der multimodale Zwischenschritte für kausale Analyse liefert.
Weiterlesen
arXiv AI Papers
MultivationBench bewertet multimodale LLMs fĂĽr Motivationsreasoning.
MultivationBench prĂĽft, ob multimodale LLMs Motivation aus Text- und Bildsequenzen erkennen, und zeigt stark Versagen.
Weiterlesen
arXiv AI Papers
EvoPINN nutzt LLMs zur Automatisierung von PINNs.
EvoPINN automatisiert PINNs für PDEs mit LLM‑Agent, verbessert Genauigkeit und reduziert L₂‑Fehler signifikant.
Weiterlesen
arXiv AI Papers
KI-Agenten prüfen Fakten: Evidence-Ledger-Methodik steigert Zuverlässigkeit.
AI‑Agents erhöhen Evidenzprüfung in wissenschaftlicher Schreibassistenz, erreichen 0,676 Genauigkeit, höher als Nicht‑Agenten.
Weiterlesen
arXiv AI Papers
Eco3S: LLM-gestütztes Agentenmodell für sozioökonomische Simulation.
Eco3S ist ein LLM‑gestützter, agentenbasierter Simulationsrahmen für Wirtschaftsforschung.
Weiterlesen
arXiv AI Papers
KI-Coding-Assistent lernt persönliche Mehrdeutigkeit aus Sitzungsverlauf.
Forscher präsentieren CAPA, Benchmark mit 600 Sitzungen, evaluiert 12 LLMs, Nutzerhistorie verbessert Erstversuche.
Weiterlesen
arXiv AI Papers
AlphaSchema eröffnet strukturierte Alpha‑Mining‑Exploration mit LLM‑Agents.
AlphaSchema nutzt strukturierte Semantik, LLMs und Surrogatmodelle, um Aktienmarktvorhersagen zu verbessern.
Weiterlesen
arXiv AI Papers
SkillBoost: neues Verfahren zur Vermeidung von Ăśberanpassung bei LLM-Agenten.
SkillBoost optimiert LLM-Agentenfähigkeiten, übertrifft 23 Benchmarks und verhindert Over‑Fitting.
Weiterlesen
arXiv AI Papers
AgenticCANN: KI-basierte Ascend C-Operatoren automatisieren NPU-Leistung.
AgenticCANN optimiert Ascend C‑Operatoren auf NPUs, erzielt bis 6,65‑faches Speed‑up, steigert Effizienz.
Weiterlesen
arXiv AI Papers
UrbanDS: Graph-gestütztes LLM-Agenten-System für städtische Datenaufgaben.
UrbanDS nutzt Multiagenten, um Daten zu analysieren, zu planen und Berichte zu erstellen.
Weiterlesen
arXiv AI Papers
Neuer Causal-Audit prĂĽft latente Kommunikation in LLM-Multi-Agent-Systemen.
Forscher entwickeln kausale Audits, messen fünf Metriken der latenten Kommunikation in Multi‑Agent‑LLMs.
Weiterlesen
arXiv AI Papers
Property‑getriebene Kausal‑Abstraktion reduziert Komplexität von MDPs.
Kausale Abstraktion reduziert MDP-Zustandsraum, liefert kompakte Modelle und nahe‑optimale Strategien.
Weiterlesen
arXiv AI Papers
Pegasus-Framework ĂĽbersetzt menschliche Videos in robotische Trainingsdaten.
Pegasus übersetzt menschliche Handlungssequenzen mittels graphbasierter Modelle in robotikfähige Daten, evaluiert auf GTEA Gaze+.
Weiterlesen
arXiv AI Papers
Neuer Drei‑Klassen‑Detektor erkennt AI‑Agenten bei Browser‑Automation.
Ein Dreiklassen-Framework erkennt Menschen, Bots und KI-Agenten korrekt und verbessert Robustheit.
Weiterlesen
arXiv AI Papers
AlphaZero und MuZero: Belief‑Guided Architektur reduziert MCTS‑Flaschenhals.
Der neue belief‑guided Ansatz reduziert MCTS‑Abhängigkeit und ermöglicht professionelle Go-Spiele auf Standardhardware.
Weiterlesen
arXiv AI Papers
Setoka: neues Benchmark für hierarchisches Nutzerverständnis bei personalisierten Agenten.
Der Setoka‑Benchmark misst Nutzerverständnis in Agenten, testet vier Ebenen und zeigt Schwächen bei episodischem Gedächtnis.
Weiterlesen
arXiv AI Papers
Routing-basierte Distillation erhöht LLM-Sicherheit.
ROPD erhöht Sicherheit spezialisierter Sprachmodelle, reduziert Leistungseinbußen bis 90 % bei Template‑Shifts.
Weiterlesen
arXiv AI Papers
AgentMap: Hybrid Ontology Matching mit LLM‑Multi-Agenten.
Hybrid Ontology Matching mit Multi-Agent-LLMs verbessert Semantik, AgentMap entdeckt Äquivalenzen und Unterordnungen.
Weiterlesen
arXiv AI Papers
LLM‑Modelle führen zu sprachlicher Monokultur.
Analyse zeigt: feste Modelle fördern Monokultur, personalisierte Modelle bewahren Vielfalt.
Weiterlesen
arXiv AI Papers
OmegaUse entwickelt OfficeVal-Benchmark fĂĽr LLM-Agenten bei langfristigen BĂĽroaufgaben mit Kostenbasis.
OmegaUse‑OfficeVal bewertet LLM‑Agenten in Office‑Aufgaben und zeigt, sie sind schneller, günstiger als Menschen.
Weiterlesen
arXiv AI Papers
CE-CM: Bayesianische Partnerfähigkeitsabschätzung für ad‑hoc‑Teamarbeit.
Bayessches Verfahren CE‑CM schätzt versteckte Teamfähigkeiten, plant dezentral, passt online an, ohne Vor‑Training.
Weiterlesen
arXiv AI Papers
KI-Agenten testen offene Forschung: Zwei Shadow‑Evaluierungen bei NeurIPS 2026.
KI-Agenten erledigten Technik, versagten Kernforschung; Autoren lehnten Papers ab, identifizierten fĂĽnf Schwachstellen.
Weiterlesen
arXiv AI Papers
ROS 2 nutzt Wissensgraphen für autonome Drohnen‑Suchmissionen in Aerostack2.
KI-gesteuerte Wissensgraphen verbessern autonome Missionsplanung und Entscheidungsfindung in ROS 2.
Weiterlesen
arXiv AI Papers
Skalierungsmodelle vorhersagen Leistung von Transformern in Teilchenphysik.
Skalierungsgesetze erlauben präzise Vorhersagen der Transformer-Leistung in der Teilchenphysik.
Weiterlesen
arXiv AI Papers
Forensische Reproduzierbarkeitsprüfung des Radiologie‑VLM Benchmarks von Claude.
Auditierung von KI-Röntgenmodellen enthüllt Datenfehler und verändert statistische Kennzahlen erheblich.
Weiterlesen
arXiv AI Papers
Erschütternde Sparsität in festen, zufälligen CNN-Extraktoren für RL.
Frozen CNN‑Features erzeugen sparse FC1‑Layer, deren Sparsität mit Komplexität skaliert; Ablation verringert Leistung.
Weiterlesen
arXiv AI Papers
LLM-Chatbots werden mit synthetischen Kunden-Twins validiert.
SCAs erzeugen digitale Zwillinge für KI-Chatbot-Verifizierung, kombiniert LLM-Judge, Experten- und Adversarial-Tests mit hoher Zuverlässigkeit.
Weiterlesen
arXiv AI Papers
Sim2Win nutzt StatBomb-Events fĂĽr teamagnostische Ergebnisvorhersage.
Sim2Win prognostiziert Sieg/Unentschieden/Verlust mithilfe von StatsBomb‑Daten ohne Teamidentität mit ROC‑AUC 0,704 und 55,4 % Genauigkeit.
Weiterlesen
arXiv AI Papers
OpenAI, Meta, Anthropic LLMs zeigen Vorurteile gegen Menschen mit geistiger Behinderung.
Studie zeigt KI‑Modelle haben Vorurteile gegen Menschen mit geistiger Behinderung, erfordert Bias‑Erkennung.
Weiterlesen
arXiv AI Papers
Bernoulli-Mixmodell: Lernkompetenz folgt Gesamtleistung, wenige Cluster.
KI-Analyse zeigt, dass UK-Schülerleistung hauptsächlich durch generelle Fähigkeit bestimmt wird, 78 % Genauigkeit.
Weiterlesen
arXiv AI Papers
KI-Agenten verlangen neue Verifizierungsinfrastruktur fĂĽr vertrauenswĂĽrdige Wissenschaft.
KI‑Agenten fordern neue Verifikationsstandards, skalierbare Workflows und klare Attribution, um Missbrauch zu verhindern.
Weiterlesen
arXiv AI Papers
LLM-basierte Intra-Paper-Verifikation revolutioniert Peer-Review-Prozesse.
Ein LLM-basiertes Framework extrahiert Novelty‑Claims, prüft Evidenz und generiert Peer‑Review-Kommentare.
Weiterlesen
arXiv AI Papers
LLM-basierte Systeme unterschätzen Lernerschwerpunkt bei Matheaufgaben.
Vier LLMs bewerten Matheaufgaben grob, unterschätzen Bruchaufgaben, warnen vor blindem Einsatz.
Weiterlesen
arXiv AI Papers
Human Utility Factor: neues Messkriterium für KI‑Governance gemäß EU AI Act.
Das HUF-Modell quantifiziert Automatisierungsauswirkungen, liefert optimalen Automatisierungsgrad und minimalen Umverteilungswert.
Weiterlesen
arXiv AI Papers
Branchenführer, Regierung und NGOs legen AI-Sicherheitsprioritäten fest.
Das Papier identifiziert vier Schlüsselbereiche für AI‑Sicherheit und fordert koordinierte, praxisnahe Projekte.
Weiterlesen
arXiv AI Papers
SimpleWikiSearch: Klare Offline‑Wikipedia‑Umgebung für LLM‑Agentensuche.
SimpleWikiSearch bietet reproduzierbare Web‑Such‑Benchmarks, nutzt bereinigte Wikipedia‑Dumps, erstellt Indizes und evaluiert LLMs.
Weiterlesen
arXiv AI Papers
GuidedRAG: semantische Steuerung erhöht Retrieval-Augmented Generation um 15 %.
GuidedRAG erhöht Trefferrelevanz bis zu 15 %, Genauigkeit um 27 % und reduziert Retrieval-Last.
Weiterlesen
arXiv AI Papers
IFCMemoryBench testet Langzeitgedächtnis von LLM-Agenten in BIM.
ICFMemoryBench bewertet Langzeit‑Speicher von KI-Agenten im BIM, zeigt 60 % Genauigkeit, fordert domänenspezifische Speicher.
Weiterlesen
arXiv AI Papers
IDP AutoOpt: Autonomer LLM-Agent optimiert Dokumenten‑Processing.
IDP AutoOpt optimiert Dokumentenverarbeitung autonom, steigert Genauigkeit, senkt Kosten und beschleunigt Konfiguration.
Weiterlesen
arXiv AI Papers
FinCacheServe mit Qwen2.5 reduziert LLM-Aufrufe bei Finanzdokumenten um 53 %.
FinCacheServe reduziert GPU‑Last und spart 53 % LLM‑Aufrufe, 44 % Strom bei großen Dokumentensätzen.
Weiterlesen
arXiv AI Papers
Hydrogenlecks früh erkennen: CFD‑GA‑DeepSets optimieren Sensorsetup.
Genetischer Algorithmus und DeepSets erhöhen Wasserstoffdetektionsrate in Garage auf 96,1 % und reduzieren Blindzonen.
Weiterlesen
arXiv AI Papers
RAFS: Neuer Score zur Erkennung stillschweigender Denkfehler in LLMs.
RAFS ist modellunabhängige Metrik, die Glaubwürdigkeit, Antwortunterstützung und Stabilität mathematischer Lösungswege bewertet.
Weiterlesen
arXiv AI Papers
Tiefe neuronale Netzwerke schätzen Gewicht und Größe aus Wildbild.
Neues 6105‑Bild‑Korpus und Deep‑Learning ermöglichen präzise BMI‑Schätzung, Multi‑Task‑Learning liefert beste Ergebnisse.
Weiterlesen
arXiv AI Papers
TraceCLIP rekonstruiert lokale Semantik aus Patch-CLS-Beiträgen.
TraceCLIP nutzt CLIP-Attention, um ohne Training semantische Segmentation in Zero-Shot zu verbessern.
Weiterlesen
arXiv AI Papers
GPT‑Red: Selbstlernendes Red‑Team trainiert GPT‑5.6 – größte LLM‑Sicherheits‑Run.
GPT‑Red, ein selbstlernender Red‑Teaming-Agent, erhöht LLM‑Sicherheit durch erweiterte Prompt‑Injection‑Erkennung.
Weiterlesen
arXiv AI Papers
Blind Resampling schlägt Self-Repair bei kleinen Code-Modellen.
ArXiv‑Studie zeigt, dass Blind‑Resampling 2,5‑5,5× Tokens spart und kosteneffizienter ist.
Weiterlesen
arXiv AI Papers
Vierlagiges Framework fĂĽr vertrauenswĂĽrdige embodied Intelligence vorgestellt.
Ein Modell fĂĽr sichere KI-Operationen definiert dauerhafte Sicherheit, bietet vier Schichten von Modell bis Deployment.
Weiterlesen
arXiv AI Papers
Hybrid‑Visionmodell misst Hautkontakt in Bildern für Sicherheitsbewertung.
Hybrid‑Vision quantifiziert Hautexposition, nutzt Mask R‑CNN und Segmentierung, passt zu manuellen Schätzungen.
Weiterlesen
arXiv AI Papers
Kognitive Konvergenz: LLMs zeigen ĂĽberraschend menschliche Denkstrukturen.
LLMs zeigen fünf kognitive Dimensionen, die menschlicher Kognition ähneln, und beschleunigen KI-Entwicklung.
Weiterlesen