TechCrunch AI
Unveröffentlichtes Anthropic-Modell erzielt Fortschritt bei Riemann-Vermutung.
Anthropic-Modell liefert neue Nullstellenmuster und Schranken der Riemann-Vermutung, bestÀtigt Forscher.
Weiterlesen
Unite.AI
KPMG-Studie und Uni Melbourne: 66âŻ% nutzen KI, Vertrauen fehlt.
Mehr als 60âŻ% nutzen KI regelmĂ€Ăig, 72âŻ% befĂŒrchten fehlende Transparenz und ethische Risiken.
Weiterlesen
arXiv AI Papers
Evaluative AI: Argumentation als Grundlage erklÀrbarer Entscheidungshilfen.
EAI nutzt Argumentation, prÀsentiert konkurrierende Hypothesen und fördert erklÀrbare, verifizierbare Entscheidungssysteme.
Weiterlesen
arXiv AI Papers
KI-OutputâGeschwindigkeit ĂŒbersteigt menschliche Kontrolle: neue FlowâbyâFlowâStudie.
FlowâbyâFlow steigert KIâĂberwachung, indem es Aufsicht ohne ContentâJudgement steuert und 90,8âŻ% Effizienz erreicht.
Weiterlesen
arXiv AI Papers
Neues Framework zur eindeutigen Strukturtheorie-Interpretationen.
Das System differenziert SchlieĂung, globale VervollstĂ€ndigung, Determinisierung, fokussiert TypeâSâStarke Theorien, nutzt LLMâModelle.
Weiterlesen
arXiv AI Papers
Aktives Inferenzmodell integriert Emotionen im menschlichen Fahren.
Active Inference erweitert Fahrmodelle um kontinuierliche Valenz- und Erregungswerte, wodurch die affektive Komponente integriert wird.
Weiterlesen
arXiv AI Papers
Data-Centric Parallel nutzt NVIDIA H200 steigert Training von langen Sequenzen um 2,88Ă.
DataâCentric Parallel steigert DeepâLearning-Training bei langen Sequenzen bis zu 2,88Ă und passt Parameter dynamisch an.
Weiterlesen
arXiv AI Papers
LinearâScans in Sprachmodellen entdecken Fehler, aber Warnungen versagen.
Lineare PrĂŒfungen erkennen korrupten Kontext, Trefferquote, keine Antwortgarantie; Hypothese widerlegt; branchâandâpick, Reâprompt, Replaceâprior beheben Fehler.
Weiterlesen
arXiv AI Papers
NL2SHACL-Bench: Benchmark fĂŒr NLâzuâSHACL Ăbersetzungen von LLMs.
NL2SHACLâBench bewertet KI-Ăbersetzungen in SHACL: vier LLMs liefern Syntax, aber Logik fehlt.
Weiterlesen
arXiv AI Papers
AgenticâAI optimiert Agentenkoalitionen und Kommunikationskosten mit ShapleyâWerten.
Forscher entwickeln kooperativen Spielansatz zur Agentenauswahl, erreicht 99,5âŻ% optimalen Nutzen mit halb so vielen Agenten.
Weiterlesen
arXiv AI Papers
MetaSpace: Metamorphische Tests fĂŒr rĂ€umliche Kognition in eingebetteten Agenten.
MetaSpace testet rĂ€umliche Kognition von KI-Agenten und zeigt erhebliche SchwĂ€chen gegenĂŒber Menschen.
Weiterlesen
arXiv AI Papers
OpenAI, Google und Alibaba testen LLM-Verhandlungen in Lieferketten.
LLMâAgenten optimieren Lieferkettenverhandlungen, aber Erfolgsrate variiert stark nach Anbieter.
Weiterlesen
arXiv AI Papers
Benchmark TREAT testet groĂe Sprachmodelle bei mathematischer TheoremâErkennung.
TREAT-Benchmark zeigt, dass groĂe Sprachmodelle theorematische IdentitĂ€ten nur 60,73âŻ% korrekt erkennen, oft stark fehlerhaft.
Weiterlesen
arXiv AI Papers
ArXiv-Paper: Autonomer KIâWissenschaftler nutzt LLMs zur quadrupeden RobotâNavigation.
AI Scientist nutzt Sprachmodelle, um autonome Forschungsloops zur Optimierung von QuadrupedâRoboterâPolicies zu entwickeln.
Weiterlesen
arXiv AI Papers
Kontinuierliches Metrafeld-Framework löst Geometrie von Robotern bis Schwarzen Löchern.
Mit kontrastivem Verlust lernt das Modell geometrische Strukturen, transferierbar fĂŒr Robotik und Schwarze Löcher.
Weiterlesen
arXiv AI Papers
TeXFix-Bench startet KI-Reparaturbenchmark fĂŒr LaTeX, Typst, Markdown.
TeXFixâBench liefert 18âKategorien-Taxonomie, testet LLMs, zeigt GPTâ4 bei 84âŻ% erfolgreicher Kompilierung.
Weiterlesen
arXiv AI Papers
CMU-Drive und V2VâVLA etablieren VisionâLanguageâAction fĂŒr kooperative Autos.
CMU-Drive: SchlieĂender EndâzuâEnd-Standard fĂŒr kooperatives autonomes Fahren, kombiniert Fahrtrichtung, Wegpunkte, Sprache, Kommunikation, liefert erste Vergleichsbasis.
Weiterlesen
arXiv AI Papers
Controlled Memory Interference: Neuer Ansatz fĂŒr kontinuierliche LLM-Agenten.
Kontrollierte GedÀchtnisinterferenz verbessert langfristiges Lernen, schrÀnkt Aktualisierbarkeit ein, erhöht die StabilitÀt kaum.
Weiterlesen
arXiv AI Papers
Agentisches KI-Pattern-Katalog fĂŒr KrankenhĂ€user: Compliance-orientierte Orchestrierung.
Compliance-First Agentic AI Framework fĂŒr Gesundheitsbranche definiert Rollen, Risikostufen und Governance, reduziert Dokumentationszeit.
Weiterlesen
arXiv AI Papers
Agent-MD kombiniert LLM und Regelagent fĂŒr GCMCâMDâDesorption.
AgentâMD kombiniert LLMâReasoning und automatisierte Steuerung, steuert Simulation, Analyse, Archivierung und bewĂ€ltigt 120 MonteâCarloâZyklen.
Weiterlesen
arXiv AI Papers
Neue multilayerâFusionâMethode fĂŒr Werteausrichtung von LLMs.
MCFâCVA erhöht ethische Vielfalt, minimiert Konflikte und liefert prĂ€zisere, vertrauenswĂŒrdigere KIâAntworten.
Weiterlesen
arXiv AI Papers
Mendel G\"odel Machine: selbstverbessernde Codierungsagenten mit vergleichender Evolution.
MendelâŻGödelâŻMachine verbessert Codeagenten durch doppelte Mutationsstrategien und schnellere Konvergenz.
Weiterlesen
arXiv AI Papers
Google Gemini und OpenAI GPTâ5.4 Mini nutzen DeepâLearningâTools zur Glaukomerkennung.
KI-gestĂŒtzte Glaukomdiagnose erreicht 88âŻ% Genauigkeit, gleichwertig zu Facharzt, verbessert Halluzinationen, 47âŻ% Genauigkeit.
Weiterlesen
arXiv AI Papers
IntelliAudit: LLM-basiertes System fĂŒr automatisierte IT-Audit-Bewertung.
IntelliAudit automatisiert Evidenzbewertung, liefert evidenzbasierte Empfehlungen, evaluiert ISO/IECâŻ27001, unterstĂŒtzt PrĂŒfer, benötigt menschliche ErgĂ€nzung.
Weiterlesen
arXiv AI Papers
Neue Forschungsagenten optimieren TextâzuâSPARQL fĂŒr DBpedia.
Selbstverbessernder Agent passt Prompt- und Regelbasis nach Inferenz an, erreichte 0,22 Genauigkeit bei DBpedia.
Weiterlesen
arXiv AI Papers
Neues Framework schĂŒtzt Patientendaten in klinischen Foundation-Modellen.
Studie prĂ€sentiert praxisnahes RisikoâAssessment fĂŒr klinische FoundationâModelle, simuliert Leakage, deckt HIPAA/GDPR ab.
Weiterlesen
arXiv AI Papers
QuantumMind: Agentische KI zur Quantenbeschleunigungsanalyse.
QuantumMind erzielt bei 582 OpenâDiscovery-Aufgaben 53,1âŻODS, 17,3âŻPunkte mehr, 99,8âŻ% erfolgreicher.
Weiterlesen
arXiv AI Papers
Adaptive Zweischichtige KapazitĂ€tsverteilung fĂŒr Standorte und Dienstklassen.
Ein ZweiâStufenâAlgorithmus verteilt KapazitĂ€t proportional und elastisch, garantiert BudgetâErhaltung.
Weiterlesen
arXiv AI Papers
DeepSeek R1 vs OpenAI o1: Nvidia verliert 589âŻMrd. Markt durch fehlende Benchmark-Transparenz.
Transparente LLMâBewertungen reduzieren Marktpanik, indem unabhĂ€ngige Leaderboards Bias aufdecken und blockchainâbasierte ScoringâProtokolle Vertrauen stĂ€rken.
Weiterlesen
arXiv AI Papers
AndroidReality: Rahmenwerk zur Messung der Robustheit mobiler Agenten.
AndroidReality bietet einen Benchmark, evaluiert mobile Agenten unter Störungen und stellt TTIR vor.
Weiterlesen
arXiv AI Papers
Capability Ladder: Neues Curriculum-Framework fĂŒr ArbeitskrĂ€fte im KIâZeitalter.
Das Framework legt fĂŒnf Stufen fest, um KI-Aufgaben umzudefinieren und Pilotkurs zu fĂŒhren.
Weiterlesen
arXiv AI Papers
Spektralfingerabdruck ermittelt Ursprung von OpenâWeightâLLMs.
LLMâFingerabdruck aus Gewichtswerten erkennt Herkunft, trennt TrainingslĂ€ufe, liefert interpretierbares GovernanceâWerkzeug.
Weiterlesen
arXiv AI Papers
CliniCAREâBench bewertet KIâModelle anhand echter MIMICâIVâEHRâAudit.
CliniCARE-Bench bewertet 25 klinische FĂ€lle bei 750 Patienten und misst Entscheidungsgenauigkeit, Evidenz, Prozess und Abstention.
Weiterlesen
arXiv AI Papers
CausalNav demonstriert zuverlĂ€ssigkeitszertifizierte KI-Weltmodelle fĂŒr physikalische ParameterĂ€nderungen.
CausalNav ist ein sicherer, graphbasierter KI-Controller, der in 200 CartPole- und Pendulum-Tests neun Baselines ĂŒbertraf.
Weiterlesen
arXiv AI Papers
DeepSeek-R1-7B LLM-Judge versagt bei evidenzgesperrter Entscheidung.
LLM-Judges verbessern Genauigkeit via ELâDGR, ohne Kosten zu erhöhen, evidenzbasiert.
Weiterlesen
arXiv AI Papers
Neue Benchmark TKFQA prĂŒft OpenâSourceâLLMs auf Faktenkonsistenz.
TKFQA bewertet mehrschichtige Faktenkonsistenz, zeigt Modelleineffizienzen, ORLF verbessert sie.
Weiterlesen
arXiv AI Papers
Zeitmaschine fĂŒr Tabellenkalkulation: neues Benchmark-Tool.
Workbook Time Machine bietet automatisierte Excel-Benchmarks; Tests zeigen, dass Detailgrad, Koordination und API entscheidend sind.
Weiterlesen
arXiv AI Papers
SurgLAT: Autonomes Laparoskop dank latenter Aufmerksamkeit.
Neues System SurgLAT steuert laparoskopische Kameras autonom, nutzt Encoder, TokenâMixer, GedĂ€chtnis, stabilisiert und validiert.
Weiterlesen
arXiv AI Papers
GRACE: LLM-basierte Metrik fĂŒr skalierbares Clustering gemischter Daten.
GRACE kombiniert semantische Werteebene mit LLM-Abfrage, validiert Cluster durch Statistik, sorgt fĂŒr Skalierbarkeit.
Weiterlesen
arXiv AI Papers
GPT-5.4âMini reduziert ReasoningâKosten um bis zu 100âŻ%.
GPTâ5.4âmini schlieĂt ReasoningâLĂŒcke, liefert 55â100âŻ% Performance, 2,7â6Ă weniger Tokens.
Weiterlesen
arXiv AI Papers
TelemetrySuffBench prĂŒft Telemetrie von fĂŒnf KI-Modellen.
TelemetrySuffBench bewertet Fehlererkennung in Agentensystemen, zeigt hohe Detektion, aber niedrige Lokalisierung.
Weiterlesen
arXiv AI Papers
GraphThink: Graphbasierte LLM-Planung fĂŒr langfristige, embodied Aufgaben.
GraphThink verbessert embodied Agenten durch Taskâ und SceneâGraphâLLMâPlanner, erreicht ALFREDâBenchmarkâLeistung.
Weiterlesen
arXiv AI Papers
KI-Detektor erkennt Benchmark-Contamination zuverlÀssig.
Forscher formalisierten, dass Nicht-Ablehnungen von α·Ï·âm abhĂ€ngen.
Weiterlesen
arXiv AI Papers
TongGuOCR: Layoutâaware OCR mit TokenâAugmentation fĂŒr chinesische Historik.
TongGuOCR verbessert historische chinesische OCR, indem es layoutâsensitives Preprocessing und tokenâaugmentierte Erkennung einsetzt.
Weiterlesen
arXiv AI Papers
ZhuLong revolutioniert EDAâSkripting: ExecutionâGrounded LLM fĂŒr PyAether und SKILL.
ZhuLong kombiniert LLM, API, Dokumenten-Analyse und Sandbox, erreichte 78,5âŻ% Pass@1.
Weiterlesen
arXiv AI Papers
REIN: Neues Framework reduziert Halluzinationen in groĂen Sprachmodellen.
REIN reduziert Halluzinationen bei groĂen Argumentationsmodellen und steigert Genauigkeit, ohne zusĂ€tzliche Controller, Suche oder MehrfachdurchlĂ€ufe.
Weiterlesen
arXiv AI Papers
MPâVRDU: Darstellung, Auswahl, BegrĂŒndung als Hauptfehler.
Studie zeigt, fehlende Seiten, irrelevante Inhalte, schlechte Beweisintegration senken Genauigkeit der MPâVRDUâModelle; Prompting kann helfen.
Weiterlesen
arXiv AI Papers
Neues DNSSE-Framework kombiniert LLM, symbolische und stochastische Tests.
DNSSE kombiniert LLMâPlanung, symbolische ConstraintâLösung und Mutationen, um verteilte KI-Programme zuverlĂ€ssig zu testen.
Weiterlesen
arXiv AI Papers
Guixu: Bewertungsgesteuerte Datensuche mit On-Chain Attestation.
Guixu nutzt dreiphasige Bewertungen, Knapsack-Optimierungen und OnâChain-Markt, um DatenqualitĂ€t fĂŒr Agenten zu schĂ€tzen.
Weiterlesen
arXiv AI Papers
KGCache: In-Memory-Cache optimiert KGQA fĂŒr LLMs und Graph-Abfragen.
KGCache beschleunigt KnowledgeâGraphâQA bis zu 1,9Ă durch InâMemoryâCaching und 6âŻ% SemanticâSpeedup.
Weiterlesen
arXiv AI Papers
NeSy-Spatial: neuro-symbolische Tools fĂŒr selbstentwickelnde rĂ€umliche FĂ€higkeiten.
NeSy-Spatial verbessert rĂ€umliche Problemlösung durch ToolâUse und Geometrie in einem geschlossenen Loop.
Weiterlesen
arXiv AI Papers
SCOUT: SelbstĂŒberprĂŒfender Tool-Thought-Agent fĂŒr ultra-lange Ego-Videos.
SCOUT optimiert die Analyse egokentrischer Videos mit adaptiven ToolâRĂŒckmeldungen, FokusâExploration und UnsicherheitsâPriorisierung.
Weiterlesen
arXiv AI Papers
CyberAGENTS: Generative AIâAgenten mit strukturierter Autonomie fĂŒr gamifizierten CybersecurityâLernen.
CyberAgents nutzt vier KI-Agenten, Ontologievalidierung und kompetenzbasiertes Fortschrittsmodell zur motivierenden Cybersecurity-Ausbildung.
Weiterlesen
arXiv AI Papers
VDGRâRAG vereint Vektorâ, Verzeichnisâ, Graphâ und Reflexionsabfrage fĂŒr Unternehmenswissen.
VDGRâRAG verbessert Unternehmensdokumentensuche durch heterogenen Wissensgraphen und vier atomare Werkzeuge.
Weiterlesen
arXiv AI Papers
Gambit: Neues Beam-Suchverfahren optimiert Testzeitrechnen fĂŒr groĂe Sprachmodelle.
Gambit steigert Inferenzleistung fĂŒr groĂe ReasoningâModelle, nutzt dynamische BeamâSearch und ĂŒbertrifft Benchmarks um 6,7âŻ%.
Weiterlesen
arXiv AI Papers
KI-Agenten: Promise-Theory schafft Haftungsrahmen.
Autonome KI-Agenten können rechtlich haftbar gemacht werden, wenn RĂŒckstoĂ messbar ist, empfiehlt Autoren.
Weiterlesen
arXiv AI Papers
AEEâEffekt: LLMs Claude, Gemini, GPT und Grok verarbeiten AutoritĂ€tssignale.
Eine Studie zeigt, dass soziale AutoritÀtssignale Entscheidungen von Claude, Gemini, GPT und Grok beeinflussen.
Weiterlesen
arXiv AI Papers
ArXivâStudie entdeckt SicherheitslĂŒcke in sarvam, mehrsprachigem MoEâModell.
Studie zeigt KI ablehnt Englisch, stimmt LowâResource-Sprachen zu; sucht kostengĂŒnstige MixtureâofâExpertsâStabilisierung.
Weiterlesen
arXiv AI Papers
SkillSmith ĂŒbertrifft OpenClaw: Lokale Agenten dank automatisierter SkillâEvolution.
SkillSmith kombiniert Cloudâ und lokale Agenten, um KIâAssistenten effizient zu optimieren und Kosten zu senken.
Weiterlesen
arXiv AI Papers
Lingjing: Simulationstestfeld fĂŒr heterogene Multi-Agenten in offenen StĂ€dten.
Lingjing simuliert heterogene Agenten in StĂ€dten, synchronisiert Physik-Engines und evaluiert 12 VisionâLanguageâModelle.
Weiterlesen
arXiv AI Papers
JustLLMGRPO: LLM senkt RadDINOâFID des SanaâGenerators.
Forscher optimieren KIâgenerierte Röntgenaufnahmen, reduzieren FID um 50,6âŻ%, verbessern Klassifikation.
Weiterlesen