AI Business
US-Handel setzt GlobalFoundries mit 300âŻMio. fĂŒr Photonik-Entwicklung.
GlobalFoundries erhĂ€lt 300 Millionen US-Dollar vom Handelsministerium fĂŒr Photonik-Forschung.
Weiterlesen
AI Models Digest
Anthropic und OpenAI fĂŒhren rollenbasierte Konfidenzsteuerung fĂŒr LLM-Toolaufrufe ein.
OpenAI und UW prĂ€sentieren Role-Stratified Conformal Risk Control, das Tool-CallâSicherheit durch RollenâKonfidenzintervalle verbessert.
Weiterlesen
arXiv AI Papers
OpenClaw und Ollama demonstrieren modulare AgenticâAI-Architektur.
Das Paper beschreibt ein Modell, das reaktive LLMs zu Agenten mit Speicher und Planung ĂŒbergeht.
Weiterlesen
arXiv AI Papers
Automatisierte Bewertung autonomer AI-Wissenschaftler: FARS, Sakana AI, CycleResearcher, Data-to-Paper.
FARS nutzt groĂe Sprachmodelle, bewertet KIâPapiere und erzielt die höchsten PeerâReviewâScores.
Weiterlesen
arXiv AI Papers
KI-Framework entdeckt neue Konjekturen mithilfe LeanâŻ4.
Automatisierte Konjekturenerkennung mit Lean 4: Pipeline aus Suche, Validierung, FormalprĂŒfung erzeugt hochwertige Probleme.
Weiterlesen
arXiv AI Papers
ThinkReset: Fortschrittliches Modell fĂŒr langfristiges, kontextbeschrĂ€nktes KIâReasoning.
ThinkReset verbessert lange Schlussfolgerungen, reduziert Redundanz, erhöht Erfolgsraten bei Langhorizont-Benchmarks.
Weiterlesen
arXiv AI Papers
TAPR: Task-Aware Prompt Rewriter steigert LLM-Performance.
TAPR optimiert LLM-Performance durch promptbasierte Reformulierung, nutzt RL, ĂŒbertrifft Basismodelle in QA, Zusammenfassung und Mathematik.
Weiterlesen
arXiv AI Papers
GenCDSR: Generative Empfehlung fĂŒr CrossâDomain-Sequenzen.
GenCDSR verbessert Genauigkeit um 1,5âŻ% und reduziert Latenz um 85,1âŻ% bei Echtzeitempfehlungen.
Weiterlesen
arXiv AI Papers
Qwen3.5-9B Modell erzeugt deduplizierte Knowledge Graphs aus heterogenen Dokumenten.
Ein OntologieâgestĂŒtztes System extrahiert EntitĂ€ten aus PDFs, Tabellen und Bildern, reduziert die Belastung um 94âŻ%.
Weiterlesen
arXiv AI Papers
SARE: Geometrische Analyse des Energieverbrauchs bei Chain-of-Thought-Algorithmen.
SARE misst CoT-Schritte mithilfe CK-Alignment, zeigt Energievariationen, Phasenwechsel und bessere Ergebnisse.
Weiterlesen
arXiv AI Papers
LLMs: Autonomer Triager ohne Sicherheitsnachweis gefÀhrlich.
LLMs bestehen medizinische PrĂŒfungen, doch autonome Triage ohne Ă€rztliche Kontrolle bleibt unsicher.
Weiterlesen
arXiv AI Papers
ViSAGE: Multimodaler Agent speichert selbstkorrigierende Langform-Videos.
ViSAGE ist ein multimodaler Agentenspeicher, der IdentitÀtsverwirrung durch Signalbinden, bidirektionale Optimierung und Verifikation verhindert.
Weiterlesen
arXiv AI Papers
STL-GO: neues Logikframework fĂŒr Multi-Agentenplanung.
Forscher prĂ€sentieren STLâGO, eine Logik fĂŒr zeit- und rĂ€umlich begrenzte Agenten, mit MIPâ und SMTâKodierungen.
Weiterlesen
arXiv AI Papers
LSR-Synth: Neue Benchmark fĂŒr Symbolische Entdeckungen.
Der LSRâSynth-Benchmark zeigt, dass feste OperatorâSets ausreichend sind, KI erweitert Lösungen nur bei eingeschrĂ€nktem Vokabular.
Weiterlesen
arXiv AI Papers
Audit bestÀtigt Diskrepanzen bei vier Agentensicherheits-Benchmarks.
Forscher bewerten 22 Modelle mit vier Benchmarks und betonen die Notwendigkeit standardisierter Sicherheitsmetriken.
Weiterlesen
arXiv AI Papers
SciToolAgentâEvo: Ontologieâbasierter selbstlernender Agent fĂŒr dynamische ToolâAkquisition.
SciToolAgentâEvo kauft autonom neue Tools, nutzt LinUCB und verifiziert Leistung mit 900 Benchmarks.
Weiterlesen
arXiv AI Papers
EarlyDx: LLMâgesteuertes Benchmark fĂŒr schnelle EDâDiagnosen in der Notaufnahme.
EarlyDx nutzt 154âŻ834 Notaufnahmeaufnahmen, Zero-Shot 3â31âŻ%, postâtraining 56âŻ%, unter klinischer Leistung.
Weiterlesen
arXiv AI Papers
Interaktionsbasierte Taxonomie lokalisiert Fehler von KI-Agenten.
Die Studie klassifiziert 41 Fehlerarten, ordnet sie Interaktionsknoten zu und bestimmt Anpassungsbedarf.
Weiterlesen
arXiv AI Papers
Forscher testen ANCHOR-Audit gegen PersonaâCollapse bei AIâKompanionen.
Studie zeigt, KIâCompanions erreichen nur 44,4âŻ% TrajektorienâGenauigkeit; ANCHOR soll messen.
Weiterlesen
arXiv AI Papers
Neues Modell fĂŒr AI-Alignment: Fragile Werte könnten Katastrophen auslösen.
Studien warnen vor Ăberoptimierung bei AI-Alignment; Designs mit Optimierungsbegrenzungen schĂŒtzen menschliche Werte.
Weiterlesen
arXiv AI Papers
Bayesian-Design optimiert experimentelle Umgebungen fĂŒr kognitive Modellierung.
Ein BED-Framework reduziert Rechenzeit bei MonteâCarlo-Benchmark, repliziert Ergebnisse nahezu exakt fĂŒr Bayesian-Parameterinferenz.
Weiterlesen
arXiv AI Papers
NeSyFS: Neuro-symbolisches FastâSlowâDenken fĂŒr LLM-Agenten bei teilweiser Beobachtung.
NeSyFS kombiniert neuroâsymbolisches FastâSlowâThinking, trennt schnelle Aktionen von langsamer Planung und verhindert Zielabweichungen.
Weiterlesen
arXiv AI Papers
MerchantBench bewertet LLM-Agenten fĂŒr langfristige KohĂ€renz im EâCommerce.
LLMs erreichen nur 27,3âŻ% menschlicher Leistungen bei langfristiger E-Commerce-Optimierung im MerchantBench.
Weiterlesen
arXiv AI Papers
SciDisco eröffnet skalierbare RL-Umgebungen fĂŒr wissenschaftliche Entdeckung.
SciDisco nutzt KI-Agenten, ProzessâVerifizierung und 14âBillionenâParameter-Variante fĂŒr fĂŒhrende hypotheseâgesteuerte Datenanalyse.
Weiterlesen
arXiv AI Papers
MMShopBench: Echtlog-Benchmark fĂŒr multimodale, mehrtönige Shopping-Agenten.
MMShopBench liefert reale Einkaufsprotokolle, offene Daten und Sandbox, um Modellleistung durch Feinabstimmung zu verbessern.
Weiterlesen
arXiv AI Papers
Neue Pipeline erhöht PrĂŒfgenauigkeit bei 29 Bauprojekten.
KI-basierte Pipeline steigert Bauprojektentscheidungen durch standardisierte Evidenzanalyse.
Weiterlesen
arXiv AI Papers
Generalisiertes Activation-Steering verbessert Chain-of-Thought-Faithfulness.
AktivierungsâSteering erhöht ChainâofâThought GlaubwĂŒrdigkeit; gröĂeres Modell steigert CueâErkennung, Effekt variiert mit Umgebung.
Weiterlesen
arXiv AI Papers
DP-GBCE: Generalized-Bayes-Modell fĂŒr effiziente Counterfactual-ErklĂ€rungen.
Studie verbindet CE mit Bayes, zeigt Gleichwertigkeit zu MAP, fĂŒhrt Bayes- und CVaR-CE-Regeln ein, kombiniert Posterioren.
Weiterlesen
arXiv AI Papers
Mehrere LLMs kooperieren: Dynamische Kollaboration steigert Intelligenz.
WILC steigert Effizienz, senkt Kosten und ĂŒbertrifft Modelle bei vier Benchmarks.
Weiterlesen
arXiv AI Papers
CAGE: Zertifizierung fĂŒr Tool-Using LLM-Agenten unter Unsicherheit.
CAGE zertifiziert LLM-Agenten, erkennt und eliminiert Fehler, sorgt autonom fĂŒr zuverlĂ€ssigere Automatisierung.
Weiterlesen
arXiv AI Papers
MirrorCraft: LLM-Agenten prĂŒfen bei versteckten RegelĂ€nderungen in Minecraft.
MirrorCraft bewertet LLMâAgenten auf AnpassungsfĂ€higkeit an versteckte RegelĂ€nderungen in Minecraft.
Weiterlesen
arXiv AI Papers
PRISM: Policy-Dekomposition fĂŒr Multi-Reward-RL.
PRISM ist ein MultiâRewardâFramework, das durch PolicyâDecomposition Rewardkonflikte vermeidet und sichere, kontrollierbare Inferenz ĂŒbertrifft.
Weiterlesen
arXiv AI Papers
SafeKeep reduziert Sicherheitsrisiken bei KI-Agenten.
SafeKeep erhöht Agentensicherheit, trennt Tool-Bewertungen, steigert Ablehnungsrate auf 70,6âŻ%, senkt Angriffsrate auf 2,5âŻ%.
Weiterlesen
arXiv AI Papers
MAGA: Multi-Plattform-GUI-Agenten durch strukturiertes Action Distillation konsolidieren.
MAGA nutzt domĂ€nenspezifische LLMs, optimiert Trainingssignale, steigert Erfolgsrate um 2âŻ% bei 8âŻB-Modellen, mobil, web, desktop.
Weiterlesen
arXiv AI Papers
Validierung agentischer KI-Systeme: Neue Herausforderungen und LösungsansÀtze.
Neue Ăbersicht ĂŒber Agentenvalidierung zeigt 257 Studien, hebt LĂŒcken in Zeit, Regulierung und Mehragentensysteme hervor.
Weiterlesen
arXiv AI Papers
ModelEquivBench: Neuer Benchmark zur Bewertung von LLM-generierten Optimierungsmodellen.
ModelEquivBench liefert ein zertifiziertes Profil, prĂŒft Modellaufbau, und zeigt variable Fehler bei LLMs.
Weiterlesen
arXiv AI Papers
AdaMM: Kombinierte Retrieval- und Analytisches GedĂ€chtnis fĂŒr multimodale Agenten.
AdaMM ist eine Speicherarchitektur, strukturiert Dialog-, Bild- und Metadaten, ermöglicht Filterung, Aggregation, Rangordnung und Vergleiche.
Weiterlesen
arXiv AI Papers
SESA: Selbstlernende Suchagenten bauen dynamische FĂ€higkeiten aus Fehlern.
SESA steigern Genauigkeit von Selbstspiel-Modellen und ĂŒbertreffen sieben QA-Benchmarks.
Weiterlesen
arXiv AI Papers
Neue Methode AMTFV verbessert mathematische Verifikation von LLMs.
AMTFV steigert KI-Modellgenauigkeit um bis zu 8,3 Punkte dank separater ToolâFlowâVerifikation.
Weiterlesen
arXiv AI Papers
COntExt erweitert Ontologien automatisch durch kontextbasierte Metriken.
COntExt automatisiert Ontologieerweiterungen mit Betriebsmetriken, verbessert Vorhersagen und senkt Wartungsaufwand.
Weiterlesen
arXiv AI Papers
LEMUR nutzt PrĂ€ferenzfeedback fĂŒr MultiâObjective Reinforcement Learning.
LEMUR nutzt menschliche PrĂ€ferenzfeedbacks, um fehlende RewardâFunktionen zu lernen und MultiâObjective RL zu optimieren.
Weiterlesen
arXiv AI Papers
DungeonBench: Benchmark fĂŒr regelreiches taktisches D&DâKampfverhalten.
DungeonBench bietet ein neues D&D-Benchmark fĂŒr KI, prĂŒft Taktik und Ressourcenplanung, unterstĂŒtzt diverse Agenten.
Weiterlesen
arXiv AI Papers
AgentHPOBench: Benchmark fĂŒr LLM-Agenten zur sequentiellen Hyperparameteroptimierung.
AgentHPOBench testet 30 MLâAufgaben, 12 LLM-Agenten sowie Baselines, zeigt Optimierungsschwierigkeiten.
Weiterlesen
arXiv AI Papers
FDD-ON Ontologie fĂŒr Fehlersuche in VAV-HVAC-Systeme.
Die modulare Ontologie FDDâON formalisiert VAVâHVAC-Komponenten, Fehlertypen, SymptomâStatus und ermöglicht KIâgestĂŒtzte Wartungsentscheidungen.
Weiterlesen
arXiv AI Papers
ExtractBench: KI-Benchmark fĂŒr schemaâgesteuerte Extraktion von Unternehmensdokumenten.
ExtractBench bewertet Genauigkeit, VollstĂ€ndigkeit, QuellenâVerankerung und Kosten anhand 4âŻ869 Seiten und 370 Dokumente.
Weiterlesen
arXiv AI Papers
GenAI-Schulung fördert kritische Zusammenarbeit ethnischer MinderheitsschĂŒler in China.
HumanâinâtheâloopâScaffolding fördert kritisches KIâCoâCreation und Selbstwirksamkeit bei chinesischen MinderheitenschĂŒlern.
Weiterlesen
arXiv AI Papers
DistServe, Splitwise und Mooncake optimieren GPU-Inference mit topologieabhĂ€ngiger DatenĂŒbertragung.
ein topologieâbewusster Transferoptimierer reduziert LLMâInferenceâLatencies drastisch, indem er PipelineâĂberlappung, NVLinkâPlacement und CXLâŻ3.0âSpeicherâExpanders nutzt.
Weiterlesen
arXiv AI Papers
Gemmaâ2â9B Distillation schĂ€rft Bias in SmolLM2 und OLMo Instruct Modellen.
ArXiv-Papier zeigt asymmetrische BiasâEffekte bei Wissensdistillation, lösbar mit PCCD.
Weiterlesen
arXiv AI Papers
LLM-as-a-Judge Systeme: Evaluative Dissonance Index enthĂŒllt.
Forscher entwickelten mit dem Evaluative Dissonance Index eine semantische Taxonomie von Halluzinationen in LLM-Judge-Systemen.
Weiterlesen
arXiv AI Papers
Vier-Welt-Framework nutzt SemArt, um KreativitÀt neu zu bewerten.
Eine Studie nutzt ein 12âTraiterâFramework, um computergestĂŒtzte KreativitĂ€t perspektivabhĂ€ngig zu bewerten.
Weiterlesen
arXiv AI Papers
MobileForge Benchmark testet multimodale Modelle fĂŒr komplette MobileâApps.
MobileForge testet multimodale LLMs bei App-Generierung, optimiert Navigation, Wartbarkeit, visuellem Realismus.
Weiterlesen
arXiv AI Papers
ConnectED nutzt VietEduQwen: KIâgestĂŒtzte Unterrichtsplanung fĂŒr Vietnam.
ConnectED nutzt LLM VietEduQwen, erreicht 87,02âŻ% Genauigkeit, verbessert vietnamesische Schulbildung.
Weiterlesen
arXiv AI Papers
LLMs erkennen saliente Appraisals mit neuem AppraiSal-Benchmark.
LLMs stĂ€rken emotionale UnterstĂŒtzung durch AppraiSal-Benchmark und PRISM-Modell.
Weiterlesen
arXiv AI Papers
COSI-Lab prĂ€sentiert multimodales KonferenzâDataset zur Modellierung sozialer Intention.
COSIâLab prĂ€sentiert multimodales Dataset, das Audio, Video und Sensoren von 32 Akademikern fĂŒr IntentâInference enthĂ€lt.
Weiterlesen
arXiv AI Papers
Generative AI verkĂŒrzt Expertenpfade in der Systemadministration.
GenAI verĂ€ndert Systemadministration: Studie zeigt, dass KI Lernwege verkĂŒrzt und Debugging-Erfahrungen reduziert.
Weiterlesen
arXiv AI Papers
HenTwin: Multimodales Digital Twin fĂŒr die Ăberwachung von Legehennen.
HenTwin nutzt einen fĂŒnfâSchichtâIoTâStapel zur 4DâĂberwachung von Legehennen bis 25âŻWochen.
Weiterlesen
arXiv AI Papers
ArXiv-Studie prĂŒft ZuverlĂ€ssigkeit von föderiertem PreâTraining.
Federated PreâTraining erfordert objektive Metriken, da FineâTuning RankingâQualitĂ€t verliert, nextâtokenâPrediction korreliert stark.
Weiterlesen
arXiv AI Papers
GRU, LSTM und Transformer erkennen Automatisierungsgrade von Openpilot, Autopilot und Super Cruise.
KI-Modelle bewerten Levelâ2-Fahrassistenzsysteme: Transformer erzielt höchsten MacroâF1, Störungen beeintrĂ€chtigen Genauigkeit.
Weiterlesen
arXiv AI Papers
Theoretische Garantie zur Unterscheidung von LLMâTokens mittels dynamischer Systeme.
Die Autoren zeigen, dass die Fehlerwahrscheinlichkeit exponentiell mit der SequenzlĂ€nge abnimmt, geregelt durch deltaÂČ.
Weiterlesen
arXiv AI Papers
Neural Net versteht physikalische Gesetze: Neues LAWFUL-Framework.
LAWFUL-Framework prĂŒft LernfĂ€higkeit physikalischer Gesetze, erkennt LĂŒcken, testet Doppler.
Weiterlesen
arXiv AI Papers
MPP-GNN: adaptive Community Detection verbessert AlzheimerâDiagnose mittels fMRI.
Neue MPPâGNN liefert höchste AUC bei AlzheimerâDiagnose dank optimierter GraphâNeuralâNetworks.
Weiterlesen
arXiv AI Papers
Metaphern steuern LLM-Codegenerierung: ineffiziente Algorithmen.
Forscherteam entwickelt MASC, um metaphorische Anweisungen zu erkennen, die ineffiziente Algorithmen aktivieren und CodeâGenerierung beeintrĂ€chtigen.
Weiterlesen
arXiv AI Papers
Reflected ODE: StabilitĂ€tsanalyse und CTMCâDrift fĂŒr heterogene Queues.
Ein reflektierter ODE-Ansatz verbessert UAS-Routing, senkt Warteschlangen, erhöht StabilitÀt und optimiert Lastverteilung in heterogenen Multi-Server-Umgebungen.
Weiterlesen
arXiv AI Papers
OurArk: Persistente Agenten mit eigenem Softwarekörper fĂŒr kontrollierte Evolution.
OurArk ist OpenâSource-Architektur fĂŒr persönliche KI-Agenten, die sich selbst entwickeln, prĂŒfen lassen und individualisieren.
Weiterlesen