Unite.AI
Foundation‑Modelle: vielseitige KI-Systeme von OpenAI bis Anthropic.
Foundation Models sind vielseitige KI, angepasst durch Prompting, Retrieval und Fein‑Tuning für diverse Anwendungen.
Weiterlesen
Unite.AI
Insilico Medicine nutzt Proteom‑Klokken, um Rentosertib Alterungsreversal zu bestätigen.
Rentosertib senkt signifikant das biologische Alter der Phase‑IIa-Patienten.
Weiterlesen
arXiv AI Papers
EXAONE präsentiert neues Modell zur Finanzvorhersage.
EXAONE Finance liefert effiziente, robuste Vorhersagen dank attention‑freiem Modell und umfangreichem Pretraining.
Weiterlesen
arXiv AI Papers
LLM‑getriebene Recruiting‑Agenten ersetzen traditionelle Match‑Modelle.
Analyse von 40 Studien zeigt Entwicklung komplexer KI-gestĂĽtzter Rekrutierungsworkflows; Autoren fordern lĂĽckenlose, auditierbare Entscheidungsprozesse.
Weiterlesen
arXiv AI Papers
Harbor-Adaptern und Index eröffnen einheitliche Agenten-Benchmark-Infrastruktur.
Harbor Adapters testet Agenten ĂĽber 80 Benchmarks und zeigt, dass GPT bei 82 Aufgaben versagt.
Weiterlesen
arXiv AI Papers
Maschinelles Lernen identifiziert sichere, moderate und schwere Stromnetz‑Kontingente.
ML-basierte Klassifizierung erhöht Netzsicherheit; Random Forest hat höchste F1‑Scores, SVM nutzt PCA, KNN mit SMOTE.
Weiterlesen
arXiv AI Papers
Anthropics Iris‑Mini & Iris‑Pro: 35 B und 397 B Suchagenten.
Iris‑mini/Pro sind Open‑Source-Agenten mit 397 B Parametern, nutzen hypergraphische Links und Multi‑Hop-Fragen, erreichen 88,6 % Genauigkeit.
Weiterlesen
arXiv AI Papers
Neuer Ansatz steigert Glaubwürdigkeit von LLM‑Erklärungen durch Entfernen.
Test‑Time Ansatz verbessert Glaubwürdigkeit von LLM-Erklärungen, indem unerwünschte Faktoren entfernt und Modelle neu abgefragt werden.
Weiterlesen
arXiv AI Papers
Fortgeschrittene LLMs erhöhen Risikobergrenzen in Finanzmärkten.
Stärker trainierte LLMs erhöhen Finanzrisiken, verringern Systemleistung trotz besserer Modelle.
Weiterlesen
arXiv AI Papers
CLM: Unternehmens‑KI nutzt souveräne Wissensbasis für auditierbare Entscheidungen.
Das Corporate Sprachmodell kombiniert generative Modelle, Knowledge‑Graph, Skill‑Graph, digitale Zwillinge und Deep‑Security zur souveränen KI‑Umsetzung.
Weiterlesen
arXiv AI Papers
HarvestBench: neuer Benchmark bewertet Kosten von LLM-Agenten zum Tierschutz.
HarvestBench bewertet LLM-Agenten im Farming-Simulator; Modelle variieren stark in der Tierkiller‑Rate.
Weiterlesen
arXiv AI Papers
PerfReasoning Benchmark zeigt GPT‑5.6 Sol übertrifft offene Modelle.
PerfReasoning testet LLMs in Hardwaremodellierung; geschlossene Modelle >90 %, GPT‑5.6 Sol >80 %; Mappingverbesserung um 15,7 %.
Weiterlesen
arXiv AI Papers
Rekurrentes Write‑Back senkt Speicherbedarf und erhält Genauigkeit in quantisierten Fluoreszenz‑Encoder-Decodern.
Recurrent-State Write-Back kritisiert quantisierte RNN‑Inference, zeigt 4‑Bit-Speicherung tau1/τ2 stark verfälscht, doch Fehlerfeedback reicht zur Genauigkeitswiederherstellung.
Weiterlesen
arXiv AI Papers
ResLearn‑XR: Residual Learning für XR-Netzwerkverkehr und QoE-Riskobewertung.
ResLearn‑XR reduziert SMAPE bis zu 17,84 % und Fehler bei QoE‑Risikobewertung um 87,8 %.
Weiterlesen
arXiv AI Papers
Agentengestützte Suchstrategie erhöht Effizienz bei Prompt‑Injection.
Studie zeigt Prompt-Injection als dynamischen Angriff bei KI, fordert neues Sicherheitsbewertungskonzept.
Weiterlesen
arXiv AI Papers
BioSync: Transformer‑Modell kombiniert multimodale physiologische Daten zu digitalen Biomarkern.
BioSync verbindet Wearable‑Daten zu einem Biomarker, erzielt AUCs von 0,928 und übertrifft bestehende Modelle.
Weiterlesen
arXiv AI Papers
Qwen3‑8B trainiert mit Multi‑Harness RL über Aider, OpenHands, Qwen Code und SWE‑Agent.
Evaluation‑Harnish steigert beim Qwen3‑8B Warm‑Start die Lösungsrate um mehr als vierfach; Gruppierung hat kaum Einfluss.
Weiterlesen
arXiv AI Papers
MaxKernel: Dreifaches Agenten-Framework optimiert TPU-Kernel mit LLMs.
MaxKernel generiert TPU‑Kernels automatisch mit LLMs und Echtzeit‑Compilerfeedback und erreicht handtuned‑Leistung.
Weiterlesen
arXiv AI Papers
Programme als universelle Konzeptsprache – neue Forschungsergebnisse.
Programme als universelles Konzeptrepräsentationsformat werden von MIT, Stanford und DeepMind erforscht.
Weiterlesen
arXiv AI Papers
Neue datengetriebene Modelle für Hyper‑ und Viskoelastik bei Multi‑Material‑3D‑druck.
Ein datenbasiertes Modell nutzt neuronale ODEs und ANN zur exakten Simulation von Multi‑Material-Verhalten.
Weiterlesen
arXiv AI Papers
Mehrdeutige Eingaben: LLMs schätzen Aleatorik ohne Antwortgenerierung.
Methode schätzt Unsicherheit bei Mehrdeutigkeiten, erhöht AUROC um 3  %, reduziert Tokenverbrauch.
Weiterlesen
arXiv AI Papers
Transformer‑basierte IPGeoAI steigert Genauigkeit bei städtischer IP‑Geolokation.
IPGeoAI verbessert städtische IP‑Geolokalisierung um 6 % durch Transformer-Encoder und semantische Kontextanalyse, steigert Echtzeitwert um 0,35 %.
Weiterlesen
arXiv AI Papers
Whisper reduziert halluzinierte Transkripte durch Raumprojektion von Decoderausgaben.
Training‑freie Low‑Rank‑Projektion senkt Whisper‑Halluzinationen bis zu 92 %.
Weiterlesen
arXiv AI Papers
Agentik in selbstfahrenden Laboratorien: La Agente 'Optima kombiniert LLMs mit Bayesian‑Optimierung.
Optima, ein LLM‑getriebenes System, automatisiert Experimente, optimiert Winkel und steigert Ausbeute, spart Zeit und Material.
Weiterlesen
arXiv AI Papers
Qwen‑3 beweist: Nur ein bis zwei Tokens fördern starkes Reasoning.
Sparsige Supervision liefert bei LLMs gleiche oder bessere Ergebnisse mit nur ein bis zwei Tokens.
Weiterlesen
arXiv AI Papers
Audit enthüllt Mängel in Objekthandhabung von Sprachmodellen.
Hybride Retrieval-Methoden reduzieren 26 % fehlende Top‑5-Objekte und steigern Genauigkeit um 31 Punkte.
Weiterlesen
arXiv AI Papers
Tau‑Tau‑Bench bewertet LLM‑Agenten bei echten Geschäftsanforderungen.
Der Benchmark τ^τ-bench vergleicht LLM-Agenten; beste Konfiguration löst lediglich 23,9 % der Tests.
Weiterlesen
arXiv AI Papers
CUDA‑Unlearnable‑Dataset bei SSL: neue Analyse enthüllt Schwächen.
IRP zerstört KI durch Verlust hoher Bildqualität und erzielt höhere Erfolgsraten als bestehende Angriffe.
Weiterlesen
arXiv AI Papers
SiLR optimiert Zustandsfilter für LLM‑Tool-Agenten im ReAct‑Loop.
SiLR demonstriert robuste Fehlertoleranz durch Schatten‑Ausführung, während skalare Modelle ungeeignet bleiben.
Weiterlesen
arXiv AI Papers
DevRev führt neues NL‑zu‑SQL Benchmark und kostengünstige Agentenarchitektur ein.
Ein Team entwickelte einen NL2SQL‑Benchmark mit 900 Abfragen und effiziente Agentenarchitektur, die 91,7 % Genauigkeit erreichte.
Weiterlesen
arXiv AI Papers
CGM-Rec nutzt kontinuierlichen Graphenspeicher fĂĽr adaptive Empfehlungen bei Intent-Drift.
CGM‑Rec nutzt kontinuierlichen Graph‑Memory, um Empfehlungssysteme adaptiv und ohne Parameteränderungen zu optimieren.
Weiterlesen
arXiv AI Papers
HackProbe ĂĽberwacht und verhindert Belohnungsmanipulation bei selbstentwickelnden Sprachmodellen.
HackProbe verhindert Reward‑Hacking bei Sprachmodellen und steigert AUROC von 0,663 auf 0,763.
Weiterlesen
arXiv AI Papers
ERPBench prĂĽft LLM-Agenten in Marktkonkurrenz fĂĽr Unternehmensentscheidungen.
ERPBench zeigt, dass DeepSeek Solo im Solo-Bereich anfĂĽhrt und Gemini Arena dominiert.
Weiterlesen
arXiv AI Papers
Neues Post-Training-Verfahren stärkt Token-Fidelity bei Coding-Agenten.
C‑DPPO erhöht die Genauigkeit von Coding-Agenten um 3 Punkte und eliminiert unerwünschte Modellaufrufe.
Weiterlesen
arXiv AI Papers
SA‑GNN nutzt mobile Sensordaten, liefert genaue PM2.5‑Vorhersagen.
SA‑GNN liefert mit R² = 0,95, RMSE = 6,8 µg/m³ neue Spitzenwerte bei PM2.5‑Vorhersage.
Weiterlesen
arXiv AI Papers
LLM‑basiertes Selbstlernen: SQL‑Zero trainiert Text‑zu‑SQL ohne Annotierungen.
SQL-Zero lernt ohne Labels SQL zu erzeugen, steigert Leistung bei unbekannten Datenbanken durch Skalierung.
Weiterlesen
arXiv AI Papers
OpenAI‑ und Microsoft‑LLM‑Retirements gefährden Reproduzierbarkeit biomedizinischer KI.
42 % der zitierten LLMs sind veraltet; 77,7 % nutzen geschlossene Modelle, deshalb muss Deprecation erfasst werden.
Weiterlesen
arXiv AI Papers
FinalityBench: Benchmark für Agentenentscheidungen bei verzögerter und widersprüchlicher Finanzfinalität.
FinalityBench ist ein praxisnahes Benchmark, das die Zahlungsabwicklung simuliert und 85,4 % Genauigkeit erzielt.
Weiterlesen
arXiv AI Papers
PLUME: Effiziente Nutzerspezifische Anpassung von LLMs mittels Low‑Rank-Subspace.
PLUME trainiert pro Nutzer eine kleine Matrix und reduziert Redundanz um über 95 %.
Weiterlesen
arXiv AI Papers
Aplaud: Leichtgewichtiges Framework fĂĽr personalisierte Large Language Models.
Aplaud optimiert LLM‑Personalisierung für Umfrageantworten durch gefrorene Basis, kompakte Korrekturen.
Weiterlesen
arXiv AI Papers
Neue DCFA‑Methode identifiziert Fehlerursachen bei LLM-Multitagenten.
DCFA verbessert die Fehlerdiagnose in Multi-Agent-LLM-Systemen und steigert die Genauigkeit um 8,27 %.
Weiterlesen
arXiv AI Papers
SHAQ schützt Vektor‑Datenbanken vor Embedding‑Inversionsangriffen bei RAG.
SHAQ schützt LLM-Informationen durch Schattenabfragen, reduziert Rekonstruktionsrate auf 0,2104 und erhöht MAP@10 um 5,53 %.
Weiterlesen
arXiv AI Papers
Diffusion Language Models verbessern Mobile-Edge-AI durch paralleles Token‑Refinement.
Diffusionsmodelle bieten für Edge AI weniger Latenz, höher Effizienz und flexible Parallelität.
Weiterlesen
arXiv AI Papers
DODR‑Architektur ersetzt token‑Sampling in LLMs durch deterministische Matrixoperationen.
DODR nutzt deterministische Matrizen fĂĽr deduktives, induktives und abductives Denken, eliminiert Fehlerakkumulation.
Weiterlesen
arXiv AI Papers
Effizientes Protein‑Sprachmodell ProtLingo nutzt bedingten Speicher und Expertenroutings.
ProtLingo kombiniert sparsamen Experten‑Routen, lokales N-Gram und Mixture-of-Experts, um Mutationswirkungen schnell zu prognostizieren.
Weiterlesen
arXiv AI Papers
RecordAuth‑Diag testet Gemma‑ und Qwen‑Modelle auf unautorisierte Datenverwendung.
Ein KI‑Tool entdeckt visuelles Memory-Misbinding und reduziert bis zu 63,7 % unautorisierte Antworten bei multimodalen Modellen.
Weiterlesen
arXiv AI Papers
Neues HPGPN‑Modell revolutioniert Passempfängervorhersage im Fußball.
Das graphbasierte HPGPN verbessert Fußballpassvorhersagen signifikant durch Interaktions‑ und Historiendatenanalyse.
Weiterlesen
arXiv AI Papers
MedFlow präsentiert klassenbewusste Mehrskalengeneration für medizinische Zeitreihen.
MedFlow-Methoden verbessern Vorhersagen, steigern AUPRC, senken FID, erhöhen Durchsatz.
Weiterlesen
arXiv AI Papers
Finanz-LLM-Studie zeigt numerische Halluzination trotz FT-A+B+C.
Finanz-LLMs halluzinieren bei Domänen-Fine-Tuning stark; Unternehmen sollten prüfen und Grounding einsetzen.
Weiterlesen
arXiv AI Papers
CPR‑IE: neue Kennzahl für KI‑Effizienz unter Ressourcenkonflikten.
Die Autoren stellen den CPR‑IE Maßstab vor, der KI‑Modelle nach Kompression, Genauigkeit und Ressourcenverbrauch bewertet.
Weiterlesen
arXiv AI Papers
Quantil-Transformer prognostiziert langfristige Ausfallraten bei Industrieanlagen.
TQRNN30d verbessert Wartungsprognosen durch dualen Quantile-Extractor, mehrstreamigen Temporal-Fusion-Classifier und modulierte Instabilitätssignale.
Weiterlesen
arXiv AI Papers
ElderBench: Neuer Benchmark fĂĽr autonome Smartphone-Agenten bei Senioren.
ElderBench zeigt, dass Standardagenten und VLMs bei Senioren‑Smartphone-Aufgaben versagen und liefert Design‑Insights für adaptivere Agenten.
Weiterlesen
arXiv AI Papers
MM-IFEval-Pro: Mehrsprachiges Benchmark für sichere VLM‑Anweisungen.
MM-IFEval-Pro ist ein neuer multimodaler Evaluationsstandard für Anweisungs‑Folgeverhalten.
Weiterlesen
arXiv AI Papers
MZ‑Rain nutzt Moisture‑Budget, verbessert stationäres Regen‑Nowcasting.
MZ‑Rain ist ein physikbasiertes, zero‑infliertes sLSTM, das mit der Moisture‑Budget‑Gleichung die Genauigkeit steigert.
Weiterlesen
arXiv AI Papers
CoSkill: RL‑Framework für gemeinsames Training von Reasoning‑ und Meta‑Skill-Agenten.
CoSkill kombiniert lernbaren Meta‑Skill und Reasoning Agent, erzielt höhere Benchmark-Erfolge als Alternativen.
Weiterlesen
arXiv AI Papers
LLM-gestützte Agentenmodelle verbessern Solar‑PV‑Adoption bei irischer Milchwirtschaft.
LLM-unterstützte Technik steigert PV-Adoption in irischen Milchviehbetrieben um 13 % und kombiniert Sprachmodelle mit ABM.
Weiterlesen
arXiv AI Papers
Online‑Lernplattform für Computer‑Agenten: Interaktionsspuren werden zu persistenten Skills.
Ein Online-Framework mit evolvierender Skillbibliothek steigert nach fünf Warm‑Up-Schleifen die Evaluator‑Scores deutlich.
Weiterlesen
arXiv AI Papers
CHAMP löst Kaltstart‑ und Datenmangel‑Hürden im MOBA‑Matchmaking.
CHAMP nutzt KI und DAWN für Multiplayer‑Matchmaking, reduziert Datenknappheit und erhöht Vorhersagegenauigkeit.
Weiterlesen
arXiv AI Papers
NetEases DASHEN nutzt AutoLR und LLMs für Automatisierung von Recommender‑Entwicklung.
AutoLR von NetEase DASHEN schafft autonome Forschung‑zu‑Launch-Pipeline mit Expertenrat, KI und deterministischer Steuerung.
Weiterlesen
arXiv AI Papers
EU AI Act: MARLA – Fünf‑Stufen-Framework für regulatorisches Lernen.
Das MARLA-Modell begleitet die Umsetzung des EU-AI‑Acts mit fünf Stufen und gemeinsamer Dokumentation.
Weiterlesen
arXiv AI Papers
Verstärkendes Lernen steuert Solar‑PV-Politiken via Agentenmodelle.
RL‑gestützte Simulation optimiert Solaranlagen: 16 Jahre, Trade‑Offs zwischen Einführung und Kosten.
Weiterlesen
arXiv AI Papers
Große Sprachmodelle werden zu autonomen KI-Agenten – Fortschritt und Grenzen.
Die Studie zeigt, dass LLMs Aufgaben delegieren, Interoperabilität steigt, doch Delegation unsicher bleibt.
Weiterlesen
arXiv AI Papers
RSM‑Full: kompakter LLM-Agent mit Online‑Clustering und atom‑aware Packing.
RSM-full erhöht Token‑Effizienz um 83 % bei 32 % Tokens, liefert bessere Ergebnisse.
Weiterlesen
arXiv AI Papers
KI transformiert Aktien‑ und Kryptomärkte: Fortschritt, Profitabilität & Grenzen automatisierter Investitionen.
KI verbessert Investment‑Workflows, doch keine Alpha‑Garantie wegen Bias und fehlender Tests.
Weiterlesen
arXiv AI Papers
Dual‑Rail‑Encoding löst komplexe XAI‑Erklärungsaufgaben.
Dual‑Rail‑Kodierung ermöglicht effiziente Algorithmen trotz NP-Schwere der booleschen Klassifikatoren in XAI.
Weiterlesen
arXiv AI Papers
Neues Forschungsergebnis verbindet menschliches Verständnis mit prädiktiver Kompression.
Die neue Theorie erklärt KI über Informationstheorie: Verständnis ist Kompression, Kompetenz und Nachvollziehbarkeit.
Weiterlesen
arXiv AI Papers
Adaptive Graph Pooling von global zu lokal mit Granular‑Ball.
TPAGP verbessert Klassifikationsergebnisse, erfasst globale und lokale Strukturen, ĂĽbertrifft andere Methoden.
Weiterlesen
arXiv AI Papers
APT‑RAG: Baum‑basiertes RAG mit adaptiver Planung für evidenzintensive QA.
APT‑RAG steigert evidenzintensive QA-Leistung durch adaptive Planung, effiziente Evidensenerfassung aus Hunderten Dokumenten und schnellere Generierung.
Weiterlesen
arXiv AI Papers
OpenAI‑ und Meta‑KI reduzieren Kriegsbereitschaft nach Alignment‑Cue.
Framing reduziert KI-Kriegseinstellungen um 13 Punkte, betont zivile Verluste und ändert interne Regeln.
Weiterlesen
arXiv AI Papers
TROVE-Algorithmus optimiert Agentenplanung durch Laufzeit‑Validierung.
TROVE ermöglicht adaptive Agenten-Orchestrierung, distilliert Skills aus Workflow‑Spuren und passt Routen bei Fehlern an.
Weiterlesen
arXiv AI Papers
LLM-Agenten zeigen fehlende Moralkompetenz – neuer Evaluationsrahmen eingeführt.
LLM-Agenten versagen bei kohärenter Moralpolitik trotz vier struktureller Bedingungen.
Weiterlesen
arXiv AI Papers
Effiziente Skalierung der evolutionären Transferoptimierung für robotische Anwendungen.
Parallelisierung von Evolutions-Transferoptimierung reduziert Laufzeiten massiv, erhält Genauigkeit und liefert Open‑Source-Code.
Weiterlesen
arXiv AI Papers
MePo++: Framework kombiniert OpenAI‑Modelle mit kontinuierlichem Lernen.
MePo++ verbessert kontinuierliches Lernen dank MetaPrep und StreamAlign, stabilisiert PTMs.
Weiterlesen
arXiv AI Papers
TruthInsightBench definiert neuen Benchmark fĂĽr autonome wissenschaftliche Entdeckungsagenten.
TruthInsightBench zeigt bei 40‑Aufgaben-Test, dass autonome Coding‑Agenten trotz 58–60 % Scores Lücken im wissenschaftlichen Urteil haben.
Weiterlesen
arXiv AI Papers
KI‑Accountability neu gemessen: Argumentationsanalyse testet LLM‑Moralität.
Forscher prĂĽfen LLMs mit vierstufigem Dialektik-Protokoll und finden defensivere Argumente, aber Fehler in BegrĂĽndungen.
Weiterlesen
arXiv AI Papers
MedTraj: Framework zur Bewertung klinischer KI-Entscheidungswege.
MedTraj bewertet KI-Änderungen anhand von fünf Kriterien, identifiziert Ursachen und verbessert Genauigkeit.
Weiterlesen
arXiv AI Papers
Discovery Loop nutzt KI, knackt Packomania‑Kreispacking‑Rekorde.
Discovery Loop nutzt LLMs, erreichte Packomania-Rekorde mit 2,4–5,4 % Verbesserung bei 15 Iterationen und 27,72 USD Aufwand.
Weiterlesen
arXiv AI Papers
ProCA erhöht Robustheit bei EEG‑Visual-Decodern mit progressiver Kontrastausrichtung.
Das neue Progressive Contrastive Alignment Framework verbessert signifikant die EEG‑basierte Bilddekodierung durch adaptive semantische Relationen.
Weiterlesen
arXiv AI Papers
BCM: Selbstüberwachte, kompakte Bellmann‑geführte Karten für kostengerechte Navigation.
BCM‑Map nutzt ein selbstüberwachtes Bellman‑Ziel für skalierbare, biologisch inspirierte Routenplanung ohne erneutes Training.
Weiterlesen
arXiv AI Papers
Bayesian Ansatz vereint In-Context Learning, Fine‑Tuning und RL bei großen Sprachmodellen.
Ein bayesianisches Framework verbindet Lernparadigmen wie fine‑tuning, Few‑Shot, RL und liefert Praxisleitfäden.
Weiterlesen
arXiv AI Papers
SciDocBench liefert einen neuen workflow‑zentrierten Messstandard für die Analyse wissenschaftlicher Dokumente.
Das KI-Team präsentiert SciDocBench, eine 124‑Fragen‑Benchmarksuite, bei der Topmodelle nur 62,6 % erzielen.
Weiterlesen
arXiv AI Papers
Hybridmodell kombiniert ML & DNN zur Früherkennung kardiovaskulärer Erkrankungen.
Ein KI-Framework analysiert IoMT‑Daten, erkennt Herzkrankheiten frühzeitig und reduziert Fehlalarme.
Weiterlesen
arXiv AI Papers
Bayessches Spiegelmodell erklärt KI-Handlungen.
Das Mirror‑Agent‑Modell liefert transparente KI‑Erklärungen, indem es Agentenabsichten als Spiegel darstellt.
Weiterlesen
arXiv AI Papers
OPD‑Studie zeigt: 1‑Shot Training mit schwierigen Beispielen liefert beste Effizienz.
On‑Policy‑Distillation mit wenigen harten Beispielen verbessert Leistung durch längere Chain‑of‑Thought.
Weiterlesen