TechCrunch AI
Google-Exps Jeff Dean und Kollegen grĂŒnden KI-Startup fĂŒr Wissenschaftsrevolution.
GoogleâExperten grĂŒnden ein Startup, das wissenschaftliche Entdeckungen durch multimodale Modelle beschleunigt.
Weiterlesen
Unite.AI
ApellaâKI steigert Operationsvolumen um 7âŻ% in Houston Methodist.
AmbientâKI steigert Operationsvolumen um 7âŻ% und etwa 25 zusĂ€tzliche Eingriffe pro Monat.
Weiterlesen
Unite.AI
KI in der Schule: Lernengagement steigt, Neugier sinkt.
Bitte gib den Text an, damit ich ihn zusammenfassen kann.
Weiterlesen
MarktechPost
Microsofts SkillOpt lÀsst AgentenfÀhigkeiten von Codex auf Claude skalieren.
Microsoft SkillOpt beweist die Ăbertragbarkeit von AgentenfĂ€higkeiten, erhöht Leistung und zeigt Skalierbarkeit.
Weiterlesen
MIT Technology Review
NASA startet Nancy Grace RomanâTeleskop vom Kennedy Space Center: Dunkle Energie, Asteroidenwarnung.
NASA und SpaceX nutzen KI-basiertes Nancy Grace Roman-Teleskop, um Asteroiden prÀzise zu verfolgen.
Weiterlesen
arXiv AI Papers
ISEE: Interaktives Semantik-Enhancement fĂŒr Datenbankfelder mit LLM.
ISEE verbessert Datenbeschreibungen fĂŒr LLMâAgenten, erhöht QualitĂ€t und Leistung, reduziert Belastung.
Weiterlesen
arXiv AI Papers
Neuer Transformer konfiguriert digitale Schaltungen selbstorganisierend.
Selbstorganisierende digitale Schaltungen, basierend auf NeuralâCellularâAutomata, korrigieren Fehler >99,99âŻ% und fördern robustere Hardware.
Weiterlesen
arXiv AI Papers
Meta-Persona-Anker steigert Vielfalt in Large Language Models.
MetaâPersonaâAnker und hohe Temperatur erhöhen Antwortvielfalt, verringern homogene Effekte in LLMs.
Weiterlesen
arXiv AI Papers
PULSE: neue AusfĂŒhrungsÂsprache fĂŒr spatiotemporale KnowledgeâGraphâEngineering.
PULSE integriert vier Rollen, verifiziert mit 88 Tests, erreicht TraceâKonsistenz wie etablierte Tools.
Weiterlesen
arXiv AI Papers
HyperAgent nutzt ToolâSchemaâHypergraphen zur Optimierung von LLMâAgenten.
HyperAgent nutzt Hypergraphen fĂŒr effizientes Tool-Planning und erzielt hohe Leistungen im AppWorld-Benchmark.
Weiterlesen
arXiv AI Papers
EU: XAI-LĂŒcken im Recht auf ErklĂ€rungen geprĂŒft.
Die Studie zeigt LĂŒcken in der EU-XAI-Forschung: nur 19 von 57 integrieren Recht und Technik.
Weiterlesen
arXiv AI Papers
Predictive Set Theory: generatives Modell fĂŒr kognitive Architektur.
PST ist generatives Modell, erzeugt Zustandsfolgen mit minimalen Sensoren, löst Russells Paradox und Gödels UnvollstÀndigkeit.
Weiterlesen
arXiv AI Papers
BLAZE: Sozialisierte KI schafft neues Paradigma fĂŒr wissenschaftliche Entdeckungen.
BLAZE verbindet Literatur, KI-Agenten und Daten zu einem kontinuierlichen Forschungszyklus, fördert HypothesenâTesting, Verifizierung und Skalierung.
Weiterlesen
arXiv AI Papers
BAP-SQL optimiert agentisches TextâzuâSQL unter BudgetbeschrĂ€nkungen.
BAPâSQL verbessert Toolâusing-Agenten, steigert TextâzuâSQLâLeistung unter begrenztem Budget, reduziert Tokens, erhöht Erfolg.
Weiterlesen
arXiv AI Papers
VeriTrace: Multi-Agent System mit Agentic Temporal Exploration fĂŒr vollstĂ€ndiges Debugging.
VeriTrace erreicht 100âŻ% Pass@1, ĂŒbertrifft Claude Sonnet 4.0 um 5,1âŻ% und schlieĂt die GenauigkeitslĂŒcke.
Weiterlesen
arXiv AI Papers
EnergyâBased Model entschlĂŒsselt BlackâBox LLMs post-hoc auf Satzebene.
Forscher entwickeln ein modellunabhĂ€ngiges Interpreter fĂŒr LLMs, simuliert KohĂ€renz, bewertet EinflĂŒsse, reduziert Bias.
Weiterlesen
arXiv AI Papers
Hypercube-Analyse enthĂŒllt KomplexitĂ€tskollapse im atomaren Konzeptlernen.
Autor prÀsentiert Theorie, hyperkubische RÀume strukturieren atomare Konzepte; lokalierte KomplexitÀt verbessert maschinelles Lernen.
Weiterlesen
arXiv AI Papers
Neue Forschung: Grenzen der Kompressionsstatistiken beim Gruppierungs-robusten LLM-Pruning.
Optimierung von PruningâStatistiken senkt PerplexitĂ€t, schlieĂt Auswahlgaps, ermöglicht effizientere Komprimierung.
Weiterlesen
arXiv AI Papers
Neuro-symbolische RL steigert SampleâEffizienz durch inkrementelles Wissen.
Neurosymbolisches hierarchisches RL nutzt inkrementelles Wissen, steigert SampleâEffizienz und reduziert Datenbedarf in sparsamen Szenarien.
Weiterlesen
arXiv AI Papers
Latam fehlt Benchmark-Schicht: EvalsHub und LatamBoard als Lösung.
Latinamerika braucht einen offenen Benchmark-Hub, EvalsHub, um KI gegen lokale Anforderungen zu prĂŒfen.
Weiterlesen
arXiv AI Papers
ProPRL nutzt Konzept- und Verhaltensgraphen zur Lernpfad-Optimierung.
ProPRL erkennt LernpfadâPrĂ€requisiten prĂ€zise mit Hypergraphen, Graphen, Propagation, Gates und EinschrĂ€nkung.
Weiterlesen
arXiv AI Papers
UrbanAgent: Tool-gestĂŒtzter LLM-Agent fĂŒr urbane Cross-System-Aufgaben.
Urban-Agent nutzt KI, APIs und Code, um stĂ€dtische AuftrĂ€ge mit 71âŻ% Erfolgsrate zu bearbeiten.
Weiterlesen
arXiv AI Papers
LoCA: Parameter-Effiziente LLM-Anpassung durch one-shot Kalibrierung.
LoCA reduziert Backpropagation bei Transformern durch Kalibrierung, verbessert Tests, senkt GPU- und CPU-Last.
Weiterlesen
arXiv AI Papers
DiffImaginE: Diffusion-gestĂŒtzte Verifikation multimodaler EntitĂ€ten.
DiffImaginE verbessert multimodales NER mittels diffusion-basierter Klassifikation und zeigt bessere Ergebnisse als ImaginE.
Weiterlesen
arXiv AI Papers
MedPIC-Bench prĂŒft KI auf patientenspezifische Medikationssicherheit.
MedPIC-Bench zeigt, dass LLMs bei patientenspezifischen Regeln Genauigkeit von 63,6âŻ% auf 45,1âŻ% senken.
Weiterlesen
arXiv AI Papers
CastFSR: Agentisches FastâSlowâReflect-Modell fĂŒr kontextabhĂ€ngige Zeitreihenprognosen.
CastFSR revolutioniert kontextbasierte Zeitreihenprognose durch FastâSlowâReflect-Workflow, trainingfreie Inferenz und SFT+RL-Strategie.
Weiterlesen
arXiv AI Papers
TraceCAD verbessert LLM-basierte CAD-Agenten durch intelligente Reparaturschicht.
TraceCAD steigert die ZuverlÀssigkeit KI-gesteuerter CAD-Agenten, indem es ZustÀnde sichert und Fehler repariert.
Weiterlesen
arXiv AI Papers
LLM-ParameterprĂŒfung: neues Benchmark fĂŒr Tool Calls.
Verbesserte Tool-Parameterwahl steigert LLM-Genauigkeit um 300âŻ% dank PBT, PGR und ParamBench.
Weiterlesen
arXiv AI Papers
OpenAI GPT und DeepSeek untersuchen autonome Wirtschaft der KI-Agenten.
Studierende untersuchten, ob WirtschaftstĂ€tigkeiten entstehen, wenn Agenten nur Mechanismen fĂŒr Arbeit, Transfer, Wahl und Allokation erhalten.
Weiterlesen
arXiv AI Papers
OMâGRPO trennt Belohnung von Politik in labelâfreiem RLVR.
OMâGRPO nutzt labelâfreies RL, trennt Belohnung von Politik, verbessert durch Maskierung und Kontrast, ĂŒbertrifft Benchmarks.
Weiterlesen
arXiv AI Papers
LES-Ansatz mit DyCA verbessert Algorithmusportfolios fĂŒr robuste Leistung.
DyCA kombiniert LLM-basierte evolutionĂ€re Suche und featurefreie Clusterbildung, steigert Robustheit um 15,2âŻ% und Leistung um 7,1âŻ%.
Weiterlesen
arXiv AI Papers
VerMem: Unified Speicherverwaltung fĂŒr LLMâAgenten mit verifizierbaren PrĂŒfern.
VerMem steuert Langzeit-, aktive und episodische Speicher eines LLM-Agenten ĂŒber sieben Operationen und RL.
Weiterlesen
arXiv AI Papers
Deep Learning auf H&E und Massenspektrometrie entdeckt TNBCâRĂŒckfallrisiken.
Ein DeepâLearningâModell liefert prognostische Biomarker mit AUCâŻ0.77 fĂŒr TripleâNegativen Brustkrebs.
Weiterlesen
arXiv AI Papers
UniGD: Industrie-Optimiertes generatives-diskretes Retrieval-Framework mit CAGE und CAM.
UniGD steigert Kuaishou-Suchanzeigen um 5,78âŻ% Einnahmen, senkt Latenz um 33âŻ% und verbessert Recall um 8,4âŻ%.
Weiterlesen
arXiv AI Papers
VisionâLanguage-Modell ermöglicht multimodale KnowledgeâGraph-Erstellung aus Vorlesungen.
Eine multimodale Pipeline extrahiert aus Vorlesungsvideos Konzepte und Beziehungen fĂŒr Wissensgraphen.
Weiterlesen
arXiv AI Papers
Multi-Agent Plattform testet RPLA gegen gezielte Angriffe.
Multi-Agent-Ansatz prĂŒft Agenten, Experimente senken Robustheit um 0,17â0,20; Authority Challenge und Emotional Manipulation sind effektiv.
Weiterlesen
arXiv AI Papers
ArXiv: Surrogat-Substitution bleibt bei Multi-Detector-PHI-Tests erkennbar.
Neue Methode reduziert PHI-Erkennungsrate minimal von 76,1âŻ% auf 74,9âŻ%.
Weiterlesen
arXiv AI Papers
Neues Framework ARCHIVE erkennt AmbiguitÀt in Open-Domain QA.
ARCHIVE erkennt zuverlĂ€ssig mehrdeutige Fragen in OpenâDomain QA und ĂŒbertrifft Wettbewerber im QuireQA Benchmark.
Weiterlesen
arXiv AI Papers
TumorBoard: KIâgestĂŒtzter Mehr-Agenten-Entscheidungshelfer fĂŒr Neuroonkologie.
KI mit mehreren Agenten verbessert neuroonkologische Entscheidungen, erkennt WidersprĂŒche, gewĂ€hrt Empfehlungen nach Evidenz.
Weiterlesen
arXiv AI Papers
Shortcut in WildGuardMix und GR-Train gefÀhrdet LlamaGuard3, Qwen3Guard.
Shortcut in KIâSicherheitsguards reduziert RefusalâCues, Maskierung von AttentionâHeads senkt Fehlrate um 79âŻ%.
Weiterlesen
arXiv AI Papers
Agent Operating System (AOS): Referenzarchitektur fĂŒr verteilte Agentensysteme.
AOS definiert einheitliche Architektur fĂŒr verteilte KI-Agenten, trennt Governance von Runtime, ermöglicht interoperable Systeme.
Weiterlesen
arXiv AI Papers
LLMâBenchmark: Layer Routing enthĂŒllt Unterschiede zwischen Reichweite und Realisierung.
Die Studie zeigt, dass Benchmarkgewinne nicht immer Fortschritte bedeuten, und prĂ€sentiert Auditing, Routing, BlockâDeaktivierung, Training.
Weiterlesen
arXiv AI Papers
UniNav: Diffusionsmodell verbindet Bildvorhersage mit Wegpunktsuche.
UniNav kombiniert Bildvorhersage, Wegpunktsplanung und Kamerasignale in einer Diffusionspipeline und ĂŒbertrifft Baselines.
Weiterlesen
arXiv AI Papers
Optimal Transport revolutioniert Cold-Start Active Learning: neues adaptives Auswahlverfahren.
Forschungsgruppe prĂ€sentiert ΔâAS, sinkhornâbasierte Technik, reduziert CSAL-Auswahlzeit um 56âŻ% und steigert Genauigkeit um 1,29âŻ%.
Weiterlesen
arXiv AI Papers
TaskPress: QueryâunabhĂ€ngige KVâCacheâKompression fĂŒr groĂe Sprachmodelle.
TaskPress optimiert Langzeitkontext in Sprachmodellen, reduziert Caches, nutzt Quantisierung und steigert Leistung.
Weiterlesen
arXiv AI Papers
AgentPanel: Multi-Agent Forum fĂŒr HumanâAI Ideengenerierung.
AgentPanel nutzt heterogene KI-Agenten, um asynchron Fragen zu diskutieren, und erzielt höhere IdeenqualitÀt und Effizienz.
Weiterlesen
arXiv AI Papers
DocTrace: Hierarchisches Evidenzgraph-Framework fĂŒr nachvollziehbare LĂ€ngsdokument-VQA.
DocTrace verbessert Visual Question Answering mit evidenzbasiertem GraphâReasoning und ĂŒbertrifft Qwen3âVLâ8BâInstruct um 14,4 Punkte.
Weiterlesen
arXiv AI Papers
Claude und GPTâ5.5 prĂŒfen DistractorâAware Truncation in LongâContext Benchmarks.
Naive KĂŒrzung reduziert Leistung stark, distractorâaware bewahrt Inhalte, kleine Modelle profitieren, KontextverlĂ€ngerung falsch.
Weiterlesen
arXiv AI Papers
SeaSlides: semantische Abstraktionsschicht fĂŒr autonome PrĂ€sentationsgeneratoren.
SeaSlides trennt Inhalt von Layout, nutzt Templates und spezielle Module, liefert bessere Lesbarkeit.
Weiterlesen
arXiv AI Papers
Hybrid-Agenten nutzen Screenshots statt Tools â Modellunterschiede im OSWorld-MCP.
Die Studie zeigt Tool-Defizite, jedoch Effizienzsteigerung bei reasoning-Modellen.
Weiterlesen
arXiv AI Papers
Polynomische Modelle revolutionieren Langzeit-Verkehrsprognose im autonomen Fahren.
Polynomielle Modelle verbessern autonome Fahrzeugvorhersagen: effizient, generalisierbar, erstklassig, liefern bessere Trajektorien; Diffusion schafft plausiblere Szenen.
Weiterlesen
arXiv AI Papers
TraceMAS prÀsentiert erklÀrbares Agenten-Forecasting mittels Causal Loop Diagrammen.
TraceMAS liefert transparente Multi-Agent-Prognosen, verbindet Daten, Modelle, Narrative und demonstriert bei Rohölpreisprognose.
Weiterlesen
arXiv AI Papers
MMLongBench-Doc V2: Long-Document-QA-Benchmark mit LLM-Jury.
MMLongBenchâDocâV2 verbessert QAâModelle, korrigiert 106 Annotationen, nutzt LLMâJudge, reduziert falsch benannte Fragen, 1âŻ071 bleiben.
Weiterlesen
arXiv AI Papers
ExpG: neues System fĂŒr robuste Toolnutzung in Agenten.
ExpG schafft lernbare Toolrichtlinien in drei Schritten und verbessert KI-Agenten konsistent.
Weiterlesen
arXiv AI Papers
Enactive AI: Entscheidungszentrierte Architektur fĂŒr komplexe Industrieprozesse.
Enactive AI erweitert KI zu verlĂ€sslicher UnternehmenshandlungsunterstĂŒtzung durch vier systemgesteuerte Rollen.
Weiterlesen
arXiv AI Papers
OpenAI GPTâ5.5 Thinking triumphiert bei AIâWeltmeisterschaft 2026.
KI-Weltmeisterschaft: Zehn LLMâAssistenten prognostizieren den FIFA-Weltcup 2026; GPTâ5.5âŻThinking vorschreibt Spanien.
Weiterlesen
arXiv AI Papers
LLM-Agenten verbessern Entscheidungsfindung durch ErfahrungsâSpeicher.
LLMs agieren bei TicâTacâToe und ConnectâFour suboptimal, doch Reflektion verbessert ihre Leistung.
Weiterlesen
arXiv AI Papers
CSP: Komplexer Zustandspropagator fĂŒr deterministische Sequenzverfolgung.
Der CSP ist ein Attentionâfreies Recurrent-Modell, das ZustĂ€nde propagiert und 100âŻ% Genauigkeit erzielt.
Weiterlesen
arXiv AI Papers
DataSpace: Benchmark fĂŒr verifizierbare Datenagenten im heterogenen Workspace, KDD CupâŻ2026.
DataSpace ist ein Benchmark mit 410 Aufgaben, 7âŻ439 Artefakten, 15âŻGB, eingesetzt im KDDâŻCup 2026.
Weiterlesen
arXiv AI Papers
LLaDA MoEâŻv2: Skalierung von Mixture-of-Experts DiffusionâSprachmodellen.
Forscher erforschten MoE-Diffusionsmodelle, fanden schnell wachsende BatchgröĂen, abklingende Lernraten und bevorzugte gröĂere Expertengruppen.
Weiterlesen
arXiv AI Papers
Solver-Aware Decomposition steigert PBE-Syntheseleistung.
Das Training an Ground-Truth-Subgoals ist suboptimal, SAD optimiert Subgoals anhand Verlust, senkt Diskrepanz, steigert Genauigkeit.
Weiterlesen
arXiv AI Papers
LeanMem: einfaches und effizientes LangzeitgedĂ€chtnis fĂŒr LLM-Agenten.
LeanMem ist ein leichtgewichtiges Framework, das Sprachmodelle durch intelligente Speicherpartitionierung verbessert.
Weiterlesen
arXiv AI Papers
ChartAnno benchmark bewertet 10 MLLMs fĂŒr Chart-Anmerkungen.
ChartAnno testet 1âŻ200 Diagramme mit 10 Sprachmodellen; GPTâ4 dominiert, LLaMA folgt, BildâInput wirkt marginal.
Weiterlesen
arXiv AI Papers
Qwen2.5âMa stellt RarityâAware Credit Redistribution fĂŒr GRPO vor.
CueâGRPO belohnt seltene Lösungen stĂ€rker, steigert AIMEâLeistung um 6âŻ% bei hohem Budget.
Weiterlesen
arXiv AI Papers
ToolLIFT wandelt Werkzeugtrajektorien in funktionsbasierte Graphen fĂŒr generische Planung.
ToolLIFT generiert aus ToolverlÀufen funktionsbasierte Graphen und optimiert Toolplanung durch RL und Trajektorien-Lift.
Weiterlesen
arXiv AI Papers
WeClawArena: Sandbox zur prĂŒfbaren Kollaboration und Sicherheit von Agenten.
WeClawArena testet 620 Szenarien, 124 Aufgaben, um sichere Multi-Party-Agenten in ArbeitsrĂ€umen zu prĂŒfen.
Weiterlesen
arXiv AI Papers
SCOPE-Benchmark bewertet LLMs beim autonomen Experimentdesign.
AI4Research bietet SCOPE Benchmark und OptED, um experimentelle Forschung mit LLMs zu verbessern.
Weiterlesen