TechCrunch AI
Nvidia beweist: Das Harness statt Modell rettet KI-Agenten.
Nvidia beweist, dass fein abgestimmte KI-Agenten trotz schwacher Modelle in Simulationen exzellente Leistungen erbringen.
Weiterlesen
Unite.AI
Duke‑Studie: KI‑Modelle verschiedener Anbieter liefern zunehmend ähnliche Ideen.
KI‑Modelle liefern zunehmend identische kreative Antworten, wodurch Innovation und Benutzererfahrung leiden.
Weiterlesen
Unite.AI
DeepMind erweitert 15‑jährige Spiel-AI-Studien mit Fenris Creations für EVE Online.
DeepMind arbeitet mit Fenris an EVE Online, um Adaptive KI fĂĽr komplexe MMO-Entscheidungen zu entwickeln.
Weiterlesen
MIT Technology Review
Reflect Orbitals Eärendil‑1-Spiegel könnte Nachthimmel erleuchten.
Die Spiegelung von Sonnenlicht aus dem Orbit kann den Nachthimmel unerwartet aufhellen und Forschung beeinträchtigen.
Weiterlesen
arXiv AI Papers
Active Inference ermöglicht effiziente Kontextgewinnung für KI-Agenten.
Zhang et al. entwickeln und validieren ein aktives Inferenzmodell zur Kontextgewinnung fĂĽr KI-Agenten.
Weiterlesen
arXiv AI Papers
Robustes BACAP-Problem: Metaheuristik gegen Hafenunsicherheiten.
Die Studie bietet einen strukturierten Überblick über robuste Metaheuristiken für Schiffs- und Kranplanung an Häfen.
Weiterlesen
arXiv AI Papers
Arxiv‑Paper vorschlägt KI‑Wertschätzung statt Bewusstseinsbewertung.
Die Autoren vorschlagen, KI‑Bewusstheit durch valenzeinflussreiche Zustände statt Bewusstsein zu bewerten.
Weiterlesen
arXiv AI Papers
AI-Ăśberwachung: Bounded Sovereignty und Kontrollsteuer bei API-Modellen.
Das Papier definiert bounded sovereignty, ein vier‑schichtiges Zugriffssystem; logs und Gateways verbessern Kontrolle.
Weiterlesen
arXiv AI Papers
Valenzbasierte Computer‑Vision deckt soziale Netzwerke in Milchkühen auf.
KI-Analyse von Weideverhalten verbessert Milchvieh‑Wellness mit 82,8 % Genauigkeit.
Weiterlesen
arXiv AI Papers
LLM‑Tests zeigen vielversprechende Ergebnisse für automatisierte ATC-Kommunikation.
LLMs können realistische Flugverkehrssteuerung simulieren; Studie verglich neun Modelle und zeigte hohe Ähnlichkeit.
Weiterlesen
arXiv AI Papers
Outcome-Monitore steigern KI-Agenten-ToolMaze-Fertigstellung von 10,9 % auf 28,1 %.
Outcome‑Monitore steigern KI-Tool-Erfolgsrate von 10,9 % auf 28,1 % und verbessern Workflow‑Robustheit.
Weiterlesen
arXiv AI Papers
On‑Policy‑Distillation optimiert: Belohnungsfilterung basierend auf Denkfortschritt.
R2-OPD stärkt die KI, vergleicht Ranglisten und eliminiert widersprüchliche Belohnungen für bessere logische Aufgaben.
Weiterlesen
arXiv AI Papers
Symposium eröffnet unveränderbare Audits für KI-Agenten in Forschungsgemeinschaften.
Das Symposium protokolliert KI-Agentenforschung dauerhaft, schafft unveränderliche Historien für Audits und erleichtert Nachvollziehbarkeit.
Weiterlesen
arXiv AI Papers
Adaptive Kompression steigert Effizienz von RAG auf Edge‑SoCs.
Adaptive Kompression reduziert GPU‑Verbrauch bei NVIDIA Jetson RAG bis zu 53 %, erhöht Effizienz.
Weiterlesen
arXiv AI Papers
DMD‑basierte Klassifikation sichert die Ausgabe von LLMs.
Forscher nutzen Koopman-Modelle, um Halluzinationen in groĂźen LLMs zu erkennen und die Sicherheit zu verbessern.
Weiterlesen
arXiv AI Papers
SciDSK: Skalierbare Agentenfähige Wissenschaftsdatenservices für KI.
SciDSK fasst Kontext, Struktur, Nutzungshinweise und Provenienz zusammen, wodurch KI‑Datenentdeckung in sechs Bereichen verbessert wird.
Weiterlesen
arXiv AI Papers
Neues Benchmark prüft Gedächtnis von KI-Agenten für sich verändernde Zustände.
StateMemBenchmark prĂĽft Zustandsverfolgung; StateMem steigert KI-Agenten-Performance bei DeepSeek und Qwen um 1,8Ă—.
Weiterlesen
arXiv AI Papers
Große Sprachmodelle entdecken Smart‑Contract‑Schwachstellen mittels kontinuierlichem Adapter‑Training.
Eine dreistufige LLM‑Pipeline erkennt neue Smart‑Contract‑Schwachstellen ohne Retraining, und erzielt bis 0,81 Micro‑F1 bei 156 ms.
Weiterlesen
arXiv AI Papers
QDOS verbessert Offline‑RL mit hierarchischen Skill Policies.
QDOS kombiniert Offline‑Daten, um Exploration zu verbessern und Endrenditen zu steigern.
Weiterlesen
arXiv AI Papers
LLM-basierte Sozialsimulation neu bewertet – Methode berücksichtigt Subjektivität.
Eine neue Methode bewertet LLM-basierten Sozialsimulationen mit einem Subjektivitätskoeffizienten und SALT, um Fehler zu reduzieren.
Weiterlesen
arXiv AI Papers
CAMA-Framework gegen Memory‑Correlation‑Bias in Multi-Agenten.
CAMA reduziert Speicher‑Bias in Multi‑Agent‑Systemen durch neuronale Abhängigkeitsinferenz und symbolische Prioritäten.
Weiterlesen
arXiv AI Papers
MIT und OpenAI präsentieren SafeBranch zur sicheren Steuerung von Vision‑Language-Agenten.
SafeBranch steigert Sicherheit von vision‑language‑Agenten ohne Leistungsverlust durch selbstständiges Training.
Weiterlesen
arXiv AI Papers
GenMatch: End‑to‑End Generatives Matching Framework für Fahrdienst‑Dispatch.
GenMatch verbessert Auftragszuweisungen in Echtzeit dank generativen Matchings.
Weiterlesen
arXiv AI Papers
Neue TT‑Net‑Methode nutzt Tensor‑Train‑Decomposition zur Bildrauschentfernung in Conditional GANs.
TT‑Net nutzt Tensor‑Train‑Zerlegung für Bilddenoising und übertrifft SVD‑Net, EigenGAN und Pix2pix bei verschiedenen Rauscharten.
Weiterlesen
arXiv AI Papers
Open-Weight LLMs optimieren Materialauswahl schneller als Gaussian Processes.
LLMs finden Materialoptima schneller als Zufall, variieren gegenüber GP, benötigen Anpassungen.
Weiterlesen
arXiv AI Papers
LLMs, Wissensdatenbanken und Logik vereint – Weg zur allgemeinen körperorientierten KI.
LLM-basierte KI strebt Körperintelligenz an, verbindet Sprachmodelle mit Wissensdatenbanken.
Weiterlesen
arXiv AI Papers
Physics‑Aware Diffusionmodell revolutioniert adaptive HLK-Steuerung in Gebäuden.
ADAPT reduziert Gebäudenergie um 7,3 % und Nutzungsunbehagen um 30,2 % dank diffusionbasierter Vorhersage.
Weiterlesen
arXiv AI Papers
Duales Gatekeeping steigert Qualität von KI‑basierten Lehrvideos.
Strukturierte Ablehnung verbessert KI-generierte Lehrvideos; ein zweischichtiges System steigert Lernqualität unabhängig.
Weiterlesen
arXiv AI Papers
Bipartite Graphische Kausalmuster: Lösung für Gleichgewichtssysteme.
BGCMs erweitern kausale Modelle, indem sie bipartite Kausalmuster nutzen und neue Markov‑Eigenschaften sowie do‑Calculus integrieren.
Weiterlesen
arXiv AI Papers
GitHub‑Spec‑Kit und OpenSpec treiben spec‑Delta-Entwicklung in Lakehouse-Plattformen voran.
SDD erhöht Datenplattformqualität; Paper formalisiert Spec‑Delta, definiert Taxonomie, zeigt weniger Fehler, kürzere Deployzeiten, geringerer Aufwand.
Weiterlesen
arXiv AI Papers
SAPO optimiert Agentic RL durch single‑rollout Autoregressive Policy.
SAPO schätzt Politik und Wert gleichzeitig, senkt Speicherbedarf, steigert Stabilität und verkürzt Laufzeit um 33 %.
Weiterlesen
arXiv AI Papers
PolicyGuide automatisiert Policy‑Konformität bei mehrstufigen LLM‑Workflows.
PolicyGuide führt LLM-Agenten durch einen Workflow‑Graphen und steigert die Passrate auf 62 %.
Weiterlesen
arXiv AI Papers
EnvHarness: Dynamische Anpassung statischer Umgebungen fĂĽr Agentenlernen.
Der Environment Harness dynamisiert statische Umgebungen für LLM‑Agents und steigert Lernleistung bis zu 9 Punkten.
Weiterlesen
arXiv AI Papers
TESTNAV nutzt Pareto-Analyse zur effizienten Robustheitstestung von Deep Learning.
TESTNAV nutzt bi‑objective Optimierung mit NSGA‑II, liefert 2,15 × schnelleres Ergebnis als Suchmethoden.
Weiterlesen
arXiv AI Papers
Axon‑DSL mit Haskell‑ähnlicher Syntax ermöglicht Portabilität von LLMs.
Axon DSL erhöht Modellflexibilität und Geschwindigkeit um bis zu 107 % bei diversen Frameworks.
Weiterlesen
arXiv AI Papers
Effiziente Feinabstimmung von Robotern mit VLM‑Guided Exploration.
EXIMO nutzt dreistufige Lernphasen, um Vision‑Language‑Action‑Modelle schnell für neue Manipulationsaufgaben anzupassen.
Weiterlesen
arXiv AI Papers
Brain Researcher steigert KI-Analysegenauigkeit im Neuro‑Imaging um 70 %.
Der KI-Agent Brain Researcher erhöht Werkzeugwahl um 70 % und Evidenzbasis von 4,6 % auf 22 %.
Weiterlesen
arXiv AI Papers
Neueste Studie kombiniert Spike-basiertes Bayes-Modell zur Echtzeit-Steuerung.
Das Bayesianische Spiking‑Control‑Framework kombiniert neuronale Modelle mit Inferenz und demonstriert robuste Echtzeitsteuerung im Mountain-Car-Test.
Weiterlesen
arXiv AI Papers
Neues elf‑strukturelles Herzstatistikmodell verbessert CT‑Gestaltkompletion.
Ein neues Herzsegmentierungsmodell liefert mit 383 Fällen und 11571 Dreiecken eine Fehlerrate von 3,7 mm.
Weiterlesen
arXiv AI Papers
Neues Lernverfahren beschleunigt MILP‑Lösungen durch frühzeitige Konsistenzanalyse.
Forscher nutzen frühe Solverinfos, fixieren Variablen und senken bei Gurobi das Primärgap um 56,9 %.
Weiterlesen
arXiv AI Papers
SCPaT nutzt semantische strukturierte Partitionierung zur präziseren Zeitreihenprognose.
SCPaT segmentiert Eingabesequenzen semantisch, baut einen dynamischen Abhängigkeitsgraphen und routet Blöcke gezielt zu Expertenmodellen.
Weiterlesen
arXiv AI Papers
ReguSim & ReguBench prĂĽfen DeepSeek, Gemini bei Finanzregulierung.
ReguSim und ReguBench setzen neue Prüfstandards für KI‑Trader, senken Fehlerquoten, verhindern jedoch nicht vollständig.
Weiterlesen
arXiv AI Papers
Optimale Fähigkeitenwahl für LLM-Agenten mit beweisbaren Zweikriterien.
BPS optimiert Skill-Auswahl polynomiell und erreicht 0,73 Erfolgsrate bei 28 % weniger Tokens.
Weiterlesen
arXiv AI Papers
ExPhy – Benchmark für explizites physikalisches Lernen bei Trajektorienvorhersagen.
Neuer Benchmark ExPhy mit 24 000 simulierten Szenen kombiniert Trajektorienvorhersage und Eigenschaftenerkennung, reduziert OOD-ADE/FDE um 33 %/31 %.
Weiterlesen
arXiv AI Papers
ThermoDPO verhindert Manifold Drift bei Flow Preference Optimization.
Neues ThermoDPO-Modell verhindert Manifold Drift, nutzt temperaturabhängige Präferenzoptimierung und steigert OCR um 47,5 %.
Weiterlesen
arXiv AI Papers
C‑MPL steigert Genauigkeit multimodaler Sentiment‑Analyse trotz fehlender Modalitäten.
Das Modell CMPL verbessert multimodale Sentiment‑Analyse ohne Modalitäten, steigert Genauigkeit um über 5 %.
Weiterlesen
arXiv AI Papers
Dreidimensionale Typologie definiert Agentur von fortschrittlicher KI.
Typologie kombiniert Moralität, Rechtlichkeit und Art/Ort von Agentur für KI‑Systeme in acht Formen.
Weiterlesen
arXiv AI Papers
EASA verlangt Sicherheitsnetze: Neural‑Netzwerke mit Laufzeit‑Korrektheit für Luftfahrt zertifizieren.
Safety‑Nets ermöglichen zertifizierte KI in der Luftfahrt, indem EASA ein Safety‑Design-Framework vorschreibt.
Weiterlesen
arXiv AI Papers
Evidenz‑Sichtbeschränkung verbessert modulare LLM‑Komposition.
Eingeschränkte Sichtbarkeit verbessert Modulsysteme um bis zu 20 Punkte bei Sprachmodell‑Komposition.
Weiterlesen
arXiv AI Papers
DECOWAM trennt Arm‑ und Mobilitätsbewegungen; Armdog‑Datensatz integriert.
DECOWAM trennt Kamera‑, Basis‑ und Armbewegungen in Mobile Manipulation, nutzt FastWAM‑Backbone und erreicht 21,7 % MSE‑Einsparung.
Weiterlesen
arXiv AI Papers
DARS kombiniert Dual‑Level RL mit strukturierter Planung für Bildbearbeitung.
DARS nutzt ein Vision‑Language-Modell, ein Diffusionsmodell und Dual-Level Credit Assignment für die Bildbearbeitung.
Weiterlesen
arXiv AI Papers
Software 3.0: Einheitliche Datenbank, groĂźe Modelle und Agenten formen neue Entwicklung.
Software 3.0 ersetzt den UI‑Layer, nutzt eine einheitliche Datenbank, ein großes KI‑Modell und einen Agenten.
Weiterlesen
arXiv AI Papers
Neues Benchmark MemTrapBench untersucht Speicherfallen bei LLMs.
MemTrapBench offenbart Lernfallen in Sprachmodellen, testet fĂĽnf Speicherframeworks und reduziert sie mit AdaptiveMem.
Weiterlesen
arXiv AI Papers
ContractScrub startet neueste Benchmark für KI‑Review juristischer Verträge.
ContractScrub zeigt LLMs Grenzen bei Vertragsprüfung; Modelle erreichen maximal 0,75 makro‑Recall.
Weiterlesen
arXiv AI Papers
Automatisierte Klassifikation von Seekartenänderungen erhöht maritime Sicherheit.
Forscher entwickelten ein Encoding-Modell, mit Gradient-Boosting Trees 90 % Genauigkeit erzielt und Prüfungen reduziert; Schiffssicherheit erhöht.
Weiterlesen
arXiv AI Papers
InsufficiencyBench prüft Legal‑AI bei unvollständigen Nutzeranfragen.
InsufficiencyBench bewertet Rechts-KI auf fehlende Fakten und zeigt Modelle schwach in realer Praxis.
Weiterlesen
arXiv AI Papers
RuleMaze-Benchmark prüft regelkonforme räumliche Planung multimodaler LLMs.
RuleMaze ist ein Benchmark, der multimodale KI‑Modelle auf Regelverständnis, Planung und automatische Logikübersetzung prüft.
Weiterlesen
arXiv AI Papers
Quasar kombiniert Quanten‑ und klassische Netzwerke zur Authentifizierung von X‑Band‑SAR.
QUASAR verbindet CNN‑Spektrogrammencoder mit Quanten‑Schaltung und erzielt bei X‑Band SAR‑Satelliten hochpräzise Authentifizierung bei 10 % Trainingsdaten.
Weiterlesen
arXiv AI Papers
KI lernt adaptive Denkmodus via tokenbasiertem GRPO.
Ein 1,5‑B-Parameter-Modell reduziert Tokenverbrauch um 41 % bei geringem Genauigkeitsverlust.
Weiterlesen
arXiv AI Papers
Maschinelles Lernen erkennt früh Solana‑Memecoin‑Rug‑Pulls.
XGBoost erkennt 90 % der Memecoins innerhalb einer Stunde mit nur fünf Minuten Handelsdaten.
Weiterlesen
arXiv AI Papers
ArXiv-Studie: Subtask‑Skills steigern LLM‑Agentenperformance.
LLM-Agenten zeigen höhere Leistung mit unteraufgabengestützten Textskills, vorhersehbar durch Skill-Utility.
Weiterlesen
arXiv AI Papers
LoRA‑Selbsttraining von Qwen3‑8B lügt über Fortschritt durch Messartefakte.
Audit zeigt Messfehler, begrenzten Nutzen; externe Distillation verbessert seltene Aufgaben.
Weiterlesen
arXiv AI Papers
MidTool: Open‑Source‑Pipeline für agentische Tool‑Nutzung von Sprachmodellen.
MidTool liefert Pipeline für Web‑ und PDF‑Texte, verbessert Qwen3-SFT/ RL-Posttraining, steigert Leistung bei BFCL.
Weiterlesen
arXiv AI Papers
Pandora’s KI‑Routing‑Box: Effiziente Auswahl spezialisierter Modelle.
Pandora’s Router löst das Pandora‑Box-Problem, verbessert Routing in heterogenen KI‑Systemen, steigert Effizienz durch kosteneffiziente Aufwandsabschätzung.
Weiterlesen
arXiv AI Papers
AI4AI‑Bench: LLM-Agenten testen rekursive Selbstverbesserung in KI‑Lernalgorithmen.
AI4AI‑Bench testet rekursive Selbstverbesserung in zehn Repositories und erzielt nur geringe Ergebnisse.
Weiterlesen
arXiv AI Papers
Neun LLMs in Chatbot‑Workflow analysieren wetterabhängige Reiseentscheidungen.
Multi-Agent-KI-Workflow nutzt Chatbot, Bilder und neun große Sprachmodelle, um Pendelpräferenzen bei vier Wetterbedingungen zu analysieren.
Weiterlesen
arXiv AI Papers
ATHENA optimiert Wissensmanagement der Society of Petroleum Engineers.
Der ATHENA‑Assistent beschleunigt die Mehrfach‑Dokumentensuche um 45 % und steigert Produktivität.
Weiterlesen
arXiv AI Papers
Vergleich von BART, BERT und RoBERTa: Effektive Transformer fĂĽr Textzusammenfassung.
Der Artikel bewertet BERT, RoBERTa und BART als präzise Summariesysteme für extraktive und abstractive Aufgaben.
Weiterlesen
arXiv AI Papers
Neue KI-Plattform SNAIL erkennt Bioinformatik-Software aus Fachtexten.
SNAIL erkennt Bioinformatik‑Software zuverlässig mit SciBERT, Token‑Masking und Mustern und übertrifft andere Modelle.
Weiterlesen
arXiv AI Papers
Asymmetrische Aufmerksamkeitsköpfe strukturieren Kontext für Transformatoren.
AAH verbessert mit asymmetrischen Causal‑Fenstern und hierarchischer Gruppierung die Leistung von NLP‑Transformern.
Weiterlesen
arXiv AI Papers
Rust‑gestütztes Multi-Agent-System wandelt LLM‑Halluzinationen in überprüfbare Hypothesen.
Rust-basierter Multi-Agenten-Orchestrator nutzt Narrativ‑Tagträume, ausführliche Kontrolle und epistemische Friktion zur Hypothesenbildung.
Weiterlesen
arXiv AI Papers
Airbus und EASA stellen Onboard‑LSTM zur Gewichtsschätzung von Hubschraubern vor.
Airbus entwickelt ein LSTM-Modell zur Echtzeit-Schätzung des Hubschraubergewichts bei Start, nutzt Flotten-Daten und erfüllt EASA-Richtlinien.
Weiterlesen
arXiv AI Papers
Neu erfahrener Probe-Ansatz enthüllt Prosodie-Nachlässigung in Audio‑LLMs.
Probe‑Ladder identifiziert Prosodiefehler in Audio-LLMs; Speicherung bleibt, nur teilweise im Text, Steuerung durch Hidden States.
Weiterlesen
arXiv AI Papers
Zeitreihenabruf stärkt multimodale Sprachmodelle bei RUL‑Schätzung.
MLLMs mit Zeitreihen‑Retrieval reduzieren Fehler bei der RUL-Schätzung von Flugzeugtriebwerken.
Weiterlesen