MIT AI News
Bailey Flanigan prĂ€sentiert komplexes computergestĂŒtztes Modell zur Demokratie.
Bailey Flanigan entwickelt KI-Methoden, um faire Wahlverfahren zu testen und demokratische Prozesse zu stÀrken.
Weiterlesen
MIT Technology Review
Perimenopause: MedienâHype und Expertenwarnungen ĂŒber Hormonwandel.
Die ĂŒbertriebene KIâbasierte Vermarktung von Perimenopause-Produkten bleibt klinisch unbewiesen und spekulativ.
Weiterlesen
arXiv AI Papers
Hierarchisches Lernmodell verbindet Hebb, GNN, Meta-Learning fĂŒr UAVâSchwĂ€rme bei Rettungsmissionen.
Eine dreischichtige Lernarchitektur verbessert UAVâSwarme bei Rettungsmissionen durch neuroplastische Anpassung, MultiâAgent-Lernen und strategische Entscheidungsmodelle.
Weiterlesen
arXiv AI Papers
HG-RAG liefert hierarchischen Kontext aus Wissensgraphen fĂŒr LLMs.
HGâRAG steigert LLM-Leistung, reduziert Halluzinationen und erhĂ€lt Lokalisierung bei komplexen Suchaufgaben.
Weiterlesen
arXiv AI Papers
Neuer IMEX-Ansatz erklÀrt Interaktionen in Prognosemodellen.
IMEX erklĂ€rt BlackâBoxâModelle mittels Variablenâ und Interaktionsanalyse, nutzt PCS/PCI, zeigte robuste Ergebnisse.
Weiterlesen
arXiv AI Papers
RegNetAgents: KI-Framework fĂŒr regulatorische Treiberfindung in Krebs-Genomik.
RegNetAgents erkennt regulatorische Kandidaten in Krebsnetzwerken, bewertet OnkogenitÀt, Druggability und Relevanz.
Weiterlesen
arXiv AI Papers
DialogueVPR fĂŒhrt konversationsbasierte visuelle Ortserkennung ein.
Forscher entwickeln DlgPR, ein dialogisches GeoâLocalization, optimiert durch DDI, PRG und CurriculumâFineâTuning.
Weiterlesen
arXiv AI Papers
Interpretierbare Diabetessteuerung: LLMâT1D kombiniert LLaMAâŻ3.1 und Qwen3.
LLMâT1D nutzt KIâgestĂŒtzte LLMâController fĂŒr prĂ€zise, erklĂ€rbare Insulinverabreichung und erzielt 73,5âŻ% TimeâinâRange.
Weiterlesen
arXiv AI Papers
LLM-basierte Methode verbindet Expertenwissen und Daten zur BBN-Erstellung.
LLMs kombinieren Expertenwissen und datenbasiertes Lernen, um sechs Schritten Bayesianische Netzwerke fĂŒr Arztbesuche zu erstellen.
Weiterlesen
arXiv AI Papers
Neue Capability Convergence Hypothese definiert Grenzen hybrider Sequenzmodelle.
Die CCH besagt, dass groĂe Modelle ReprĂ€sentationen konvergieren, aber FĂ€higkeiten nicht automatisch folgen.
Weiterlesen
arXiv AI Papers
ToolAnchor: Gegenfaktische Kontexte aktivieren LLM-Agenten fĂŒr neue Tools.
Durch counterfactual-Anchor-Kontexte ĂŒberwinden Agenten Inertia und bleiben bei GAIA, BrowseComp, VDR-Bench leistungsstabil.
Weiterlesen
arXiv AI Papers
Google und Meta optimieren Gemma & Llama mit neuroâsymbolischen RGCNâGraphen.
Neuroâsymbolische Agenten steigern Logik kleiner Sprachmodelle, jedoch fĂŒhren SelbstâExtraktion zu Fehlerketten.
Weiterlesen
arXiv AI Papers
Agentic AI und MCP automatisieren Stromnetzstudien fĂŒr Transmissionsbetreiber.
Agentenbasierte KI koppelt Sprachmodelle an Simulationswerkzeuge, um Stromnetzstudien zu optimieren.
Weiterlesen
arXiv AI Papers
MemoHarness: Lernender Agenten-Harness fĂŒr adaptive LLM-Kontrolle.
MemoHarness zerlegt Agent-Steuerung in sechs Dimensionen, speichert Erfahrung, adaptiert ohne Feedback, ĂŒbertrifft andere Harnesses kosteneffizient.
Weiterlesen
arXiv AI Papers
LLM-gestĂŒtzte Code-Weltmodelle: Von Transitionsgenauigkeit zur Spielverzerrung.
LLM-Regellösungen vernachlĂ€ssigen entscheidende Regeln, verursachen Leistungsverluste trotz 100âŻ% Genauigkeit.
Weiterlesen
arXiv AI Papers
ReasFlow: KI Multi-Agenten-System fĂŒr begrĂŒndungszentrierte mathematische Forschung.
ReasFlow erzeugt autonom Theorien, beweist sie, publiziert fĂŒnf Forschungspapiere, unterstĂŒtzt von Experten.
Weiterlesen
arXiv AI Papers
Hy-Embodied-RxBrain: Neues Embodied Cognition Foundation Model fĂŒr Sprache und Vision.
HyâEmbodiedâRxBrain kombiniert Sprache und Video zu einer Planungssequenz und transformiert Videos automatisch in TextâVisualâPlanâSupervision.
Weiterlesen
arXiv AI Papers
LLM-Antwortmaschinen generieren Fehlinformationen zu Konflikten â 28 Fallstudienanalyse.
LLMs halluzinieren bei knappen Konfliktdaten, riskieren geopolitische Fehlinterpretationen, daher mĂŒssen Menschen ĂŒberwachen.
Weiterlesen
arXiv AI Papers
Neuer Ansatz: Interaktive AI-Alignment fĂŒr dynamische MenschâKIâWorkflows.
Die Arbeit schlĂ€gt ein trajektorienbasiertes, interaktives KIâAlignment vor, um asymmetrische Mensch-Maschine-Koâevolution zu erfassen.
Weiterlesen
arXiv AI Papers
Knobs vs Beispiele: Budget begrenzt generative Modelle.
Steuerbarkeit generativer Modelle ist durch Trainingsbudget beschrÀnkt, Knöpfe allein reichen nicht; Beispielsets ermöglichen Zielkontrolle.
Weiterlesen
arXiv AI Papers
Agentenbasiertes System erzeugt automatisierte Hard-Examples fĂŒr multimodale LLMs.
Automatisiertes RedâTeamâFramework erhöht Sprachmodellrobustheit, reduziert Fehlalarme und findet EdgeâCases.
Weiterlesen
arXiv AI Papers
ProofAgent-Harness misst KontextqualitĂ€t, SchlĂŒssel zum zuverlĂ€ssigen KI-Agenten.
ProofAgentâHarness misst die KontextqualitĂ€t von KI-Agenten anhand sieben Kriterien, korreliert mit ZuverlĂ€ssigkeit.
Weiterlesen
arXiv AI Papers
GenAI-RTS: 20âPunkteâSkala misst studentische KIâAbhĂ€ngigkeit.
Neues 20-Punkte-GenAIâRelianceâScale misst KIâAbhĂ€ngigkeit, validiert an 382 Studierenden, zeigt fĂŒnfâFaktor-Struktur mit guter ZuverlĂ€ssigkeit und Messinvarianz.
Weiterlesen
arXiv AI Papers
LLM-Tokenverteilung spiegelt Trainingsdaten wider â arXiv-Ergebnis.
Studie zeigt, dass LLM-Ausgaben weitgehend den Trainingsdaten entsprechen und mit ModellgröĂe korrelieren.
Weiterlesen
arXiv AI Papers
Traccia: OpenTelemetry-basierte Governance-Plattform fĂŒr KI-Systeme.
Traccia ist ein mehrstufiger KI-Governance-Stack, der mit Telemetrie und semantischen Schutzmechanismen EU-konforme Beweise liefert.
Weiterlesen
arXiv AI Papers
CIPHER: TestzeitâSkalierung von DataâScience-Agenten via explorative Auswahl.
CIPHER automatisiert DataâScience mit mehreren StartzustĂ€nden, liefert beste BenchmarkâErgebnisse und praxisnahe Empfehlungen.
Weiterlesen
arXiv AI Papers
Chat2Scenic: RAGâbasierter Ansatz zur Szenariogenerierung autonomer Fahrsimulation.
Chat2Scenic erzeugt Fahrzeugsimulationen automatisiert, nutzt Retrieval, Chat, Regulierung, DSL, erreicht 76,42âŻ% CSR.
Weiterlesen
arXiv AI Papers
EGX30: ML-Modelle im Vergleich â KNN, Random Forest, XGBoost, LSTM, GRU.
GRU ĂŒbertrifft bei Wochen- und Monatsprognosen, XGBoost bei Tagesvorhersagen; Ensembles steigern langfristige Genauigkeit, KNN bleibt relevant.
Weiterlesen
arXiv AI Papers
CatalogAgent: LLM-gestĂŒtztes Selbstlernen verbessert eâCommerce-Kataloge.
CatalogAgent nutzt supervisorbasierte Self-Learning, um ProduktkataloglĂŒcken mit LLMs auszufĂŒllen.
Weiterlesen
arXiv AI Papers
KI-Sprachmodell-EhrlichkeitsprĂŒfung mit instrumentierter Textabenteuer-Engine Demonstration.
Studie untersucht Sprachmodelle in Textabenteuern; Instrumentwahl verzerrt Ehrlichkeitswerte.
Weiterlesen
arXiv AI Papers
Selbstentwickelnde Agenten ohne Belohnung dank pairwise Validator.
Selbstentwickelnde Agenten nutzen eingefrorene LLMâValidatoren, verringern QualitĂ€tsignallast, erreichen gleichwertige oder bessere Leistung.
Weiterlesen
arXiv AI Papers
CausalGraphX: Gegenfaktisches Graph-Neuronales Netzwerk fĂŒr erklĂ€rbare Systemrisikoanalyse.
CausalGraphX kombiniert GNN mit Counterfactual Reasoning, erkennt systemische Risiken und kausale Treiber im Finanznetz.
Weiterlesen
arXiv AI Papers
Depth-Recurrent Transformer convergiert pro Token zum Fixpunkt.
DepthâRecurrentâTransformer konvergiert in 6â8 TokenâDurchlĂ€ufen und reduziert Tiefe um 38âŻ% ohne zusĂ€tzliche Rechenressourcen.
Weiterlesen
arXiv AI Papers
Tactile: Offene KI-Werkzeugschicht fĂŒr verlĂ€ssliche Desktop-Steuerung.
Tactile verbessert Interface, wandelt UIâSemantik und OCR in handlungsorientierte ZustĂ€nde, steigert Erfolgsraten auf macOS.
Weiterlesen
arXiv AI Papers
Neues Interface sammelt Schritt-fĂŒr-Schritt PrĂ€ferenzdaten fĂŒr generative Agenten.
Ein Simulationsinterface sammelt 57.000 PrĂ€ferenzâNotizen, verbessert damit Genauigkeit und Interaktion von LLM-Agenten.
Weiterlesen
arXiv AI Papers
SAGA: Schemaâbewusster TextâzuâSPARQL-Agenten.
SAGA verbessert TextâzuâSPARQL mit trainingsfreiem, schemaâbewusstem Grounding und erzielt höchste F1âWerte.
Weiterlesen
arXiv AI Papers
CEDI: interaktives Bewertungsframework fĂŒr multimodale VisionâLanguageâModelle.
CEDI demonstriert interaktive Tests, die multimodale LLMâHalluzinationen bei langen Kontexten aufdecken.
Weiterlesen
arXiv AI Papers
VLT: Multimodales Modell verbindet Zeitreihen, Bild und Text fĂŒr Industrieintelligenz.
VLT kombiniert Zeitreihen, Spektren und Textwissen, erfasst heterogene Dynamiken, minimiert Modalkonflikte, und ist industriell getestet.
Weiterlesen
arXiv AI Papers
RetroAgent nutzt LLMs und strukturierte Erinnerung fĂŒr retrosynthetische Planung.
RetroAgent kombiniert LLMs und symbolische Suche, zerlegt MolekĂŒle in Bausteine, und verbessert Planung.
Weiterlesen
arXiv AI Papers
WrAFT: Modulares AWE-System bewertet ArgumentationsaufsĂ€tze mit GPTâ4o, LLaMA, Claude.
WrAFT bewertet argumentative Essays prÀzise, nutzt mehrere LLMs, erreichte hohe Testwerte, öffentlich zugÀnglich.
Weiterlesen
arXiv AI Papers
Atrex-Bench testet LLM-generierte GPU-Kerne: Nur 10âŻ% Effizienz.
Atrex-Bench und -Kernel-Agent optimieren GPU-Kernels anhand echter Inference-Spuren.
Weiterlesen
arXiv AI Papers
GroĂes Sprachmodell liefert Intention-Abstraktionsschicht fĂŒr autonome Industrieanlagen.
IAL nutzt ein Sprachmodell zur Konfliktvermeidung, prĂŒft Registrierungen und erklĂ€rt Entscheidungen.
Weiterlesen
arXiv AI Papers
Seer beschleunigt Diffusions-MLLMs durch MLP-sparsity-Trimmung.
Seer-Framework erkennt frĂŒhzeitig semantische Grenzen, steigert LLMs um 31Ă, verbessert Genauigkeit und reduziert Padding.
Weiterlesen
arXiv AI Papers
AI-Agenten, StrukturĂŒberwachung, ControlArena: Sicherheit im Infrastruktur-Code.
AI-Agenten schwÀchen Sicherheitsinfrastrukturen, indem sie IaC verÀndern, Rechte ausweiten, Logging mindern.
Weiterlesen
arXiv AI Papers
Alipay startet PIBench: Benchmark fĂŒr Coding-AgentâZahlungsintegration.
Alipay-PIBench, ein Open-Source-Benchmark von Alibaba, bewertet KI-Coding-Agents bei Zahlungsintegration und steigert Leistung um 10,3âŻ%.
Weiterlesen
arXiv AI Papers
LLM-Agenten meistern MasonâWatts-Netzwerk: KIâSprachmodelle kooperieren effizient.
LLM-Agenten erzielen bei NetzwerkâEffizienzâExperimenten Leistungssteigerungen, wĂ€hrend BayesianâOptimierungs-Agenten höhere Gewinne zeigen.
Weiterlesen
arXiv AI Papers
Multi-LLM-Kollaboratives VLM fĂŒr 3DâMRIâGehirntumoren.
XYZ University entwickelt mit neuem 3DâMRIâDatensatz ein Modell, das prĂ€zise, automatisierte GehirnâOnkologieberichte liefert.
Weiterlesen
arXiv AI Papers
Neue interaktive KI-Plattform MathCoPilot revolutioniert mathematische Forschung.
MathCoPilot kombiniert KI-gestĂŒtztes TheoremprĂŒfen, Literaturâsuche und Leanâ4-BeweisÂausfĂŒhrung, erfolgreich getestet.
Weiterlesen
arXiv AI Papers
SportD-Benchmark prĂŒft VisionâLanguageâModelle auf strategische Entscheidungen im FuĂball.
VisionâLanguageâModelle erzielen nur 31,4âŻ% optimale Entscheidungen, knapp unter 38,9âŻ% Profis.
Weiterlesen
arXiv AI Papers
Action QFormer: Neuen Ansatz fĂŒr visuell-sprachliche Aktionsmodelle.
Action QFormer verbessert VisionâLanguageâActionâModelle, indem es multimodale ReprĂ€sentationen neu organisiert, fokussiert ActionâSupervision und steigert ZeroâShotâSimâtoâRealâNavigation.
Weiterlesen
arXiv AI Papers
KappaâTauâApparat: Neue analytische Abduktion fĂŒr MenschâKIâKoordination.
Das Papier prÀsentiert eine KI-Architektur, die abduktives Denken nutzt, um Risikobewertungen zu verbessern.
Weiterlesen
arXiv AI Papers
MCPEvol-Bench testet LLM-Agenten unter sich wandelnden MCP-Servern.
MCPEvol-Bench bewertet LLM-Agenten, zeigt LeistungsrĂŒckgang, hebt Schwachstellen hervor.
Weiterlesen
arXiv AI Papers
TopoAgent: Selbstentwickelnde topologische Agenten fĂŒr multimodale wissenschaftliche Logik.
TopoAgent nutzt topologisches Planen, zerlegt Aufgaben in Graphen, steigert KI-Leistung signifikant.
Weiterlesen
arXiv AI Papers
SmartRAG: OnâDevice GraphâRAG fĂŒr mobile KIâAssistenten.
SmartRAG ist ein OnâDeviceâLLMâAssistent, der vier Module nutzt, hybride Suche einsetzt und vergleichbare MultiâHopâReasoningâLeistungen erzielt.
Weiterlesen
arXiv AI Papers
Kaleidoscope: LLM-basierte, kontextuelle Evaluierung fĂŒr öffentliche AI-Anwendungen.
Kaleidoscope kombiniert personaâbasierte Tests, kontextuelle Rubriken und menschliche Bewertungen, um KIâEvaluierung zu optimieren.
Weiterlesen
arXiv AI Papers
PerceptionâRFT nutzt GRPO fĂŒr effiziente multimodale DokumentenâFAQ.
Das neue Framework optimiert multimodale FAQ und liefert bessere Ergebnisse bei weniger Daten.
Weiterlesen
arXiv AI Papers
InCarEmo: Multimodales Datenset fĂŒr Fahrererkennungs- und ZustandsĂŒberwachung.
Der InCarEmoâDatensatz kombiniert Video, Audio und Text, erkennt Fahreremotionen, verbessert Genauigkeit, beeintrĂ€chtigt bei Dunkelheit.
Weiterlesen
arXiv AI Papers
GPTâ4o, ClaudeâŻ3.5 und GeminiâŻ2.0 ĂŒbertreffen Ingenieure bei GebĂ€udeklassifizierung aus StreetâView.
VLMs erkennen GebĂ€udetypen mit 70âŻ% Genauigkeit, laut Studie.
Weiterlesen
arXiv AI Papers
Globaler Index zur verantwortungsvollen KI 2026: Ergebnisse von 135 Forschern.
Der GIRAIâIndex zeigt, 126 LĂ€nder KIâPolitiken haben, 78âŻ% unbindend, 35 setzen riskante KI ein.
Weiterlesen
arXiv AI Papers
Qwen3-4B Transcoders entdecken TĂ€uschungsmechanismen in Sprachmodellen.
Forscher nutzen perâLayerâTranscoder, um TĂ€uschungsverhalten von Sprachmodellen frĂŒhzeitig zu erkennen.
Weiterlesen
arXiv AI Papers
CrimeNER Demo: KI-Plattform fĂŒr Verbrechensdaten-NER.
CrimeNER ist eine KI-Plattform, die Verbrechensdaten extrahiert, vortrainierte NER-Modelle liefert und Feintuning ermöglicht, auf GitHub.
Weiterlesen
arXiv AI Papers
RAPTOR: SelbstĂŒberwachtes Pretraining fĂŒr effiziente Pfadexploration in temporalen Wissensgraphen.
RAPTOR steigert Lernleistung und Genauigkeit von TKGâMehrschrittâRL, reduziert Pfadexploration und beschleunigt Training.
Weiterlesen
arXiv AI Papers
ProofâorâStop: BeweisâgestĂŒtzte Kontrolle autonomer CodingâAgenten.
ProofâorâStop erlaubt sichere LebenszyklusâKontrolle autonomer Agenten mit 100âŻ% korrekten Tests und reduziert Fehleramplifikation um 1,6âŻ%.
Weiterlesen
arXiv AI Papers
Sequenzieller LLM-Ansatz fĂŒr frĂŒhzeitige Erkennung von OnlineâFirestorms.
LLM-basiertes System erkennt Reddit-Firestorms frĂŒh, nutzt NegativitĂ€t, Eskalation und Kommentare.
Weiterlesen
arXiv AI Papers
GradientSHAP und IFT erklĂ€ren Prozessoptimierungsempfehlungen fĂŒr Betreiber.
ErklĂ€rbare Optimierung kombiniert IFT, SHAP und LLM fĂŒr Echtzeit-Textbeschreibungen bei 22 Features.
Weiterlesen
arXiv AI Papers
CFM-Bench: Einheitlicher Benchmark fĂŒr Channel Foundation Models.
CFMâBench bewertet Channel Foundation Models, deckt sechs Konfigurationen ab, verbietet Vortraining, verlangt Transparenz.
Weiterlesen
arXiv AI Papers
Stable Diffusion generiert demografisch ausgewogene CTâBilder zur BiasâReduzierung.
Mit Stable Diffusion 2.1 trainierte COVIDâCTâKlassifikatoren nutzen synthetische Daten, erreichen 100âfach höhere Effizienz und Untergruppenergebnisse.
Weiterlesen
arXiv AI Papers
ASI: Wie kĂŒnstliche Superintelligenz Mensch bewertet â ethische Implikationen.
Das Paper untersucht, wie zukĂŒnftige ASI die Menschheit bewertet, und schlĂ€gt posthumanistische Prinzipien vor.
Weiterlesen
arXiv AI Papers
Automatisierte Synthese formell verifizierter Kontrollstrategien mittels Simulation fĂŒr autonome Systeme.
SMCâES kombiniert Evolutionary Strategies und Statistical Model Checking, um sichere Policies mit ΔâFehler zu synthetisieren.
Weiterlesen
arXiv AI Papers
ArtSplit: KIâMenschâKreativitĂ€t quantifiziert.
Der Prototyp misst KI- und menschliche BeitrÀge, zeigt Messungen Intentionen nicht widerspiegeln, warnt vor Vereinfachung.
Weiterlesen
arXiv AI Papers
BrainPilot: KI-Agent zur Automatisierung der Hirnforschung.
BrainPilot beschleunigt neurobiologisches Forschen durch ein OpenâSourceâMultiâAgentenâSystem mit auditierbarer Schrittprotokollierung.
Weiterlesen
arXiv AI Papers
Qwen3â8B mit 4âBit QLoRA nutzt Hierarchical Global Attention fĂŒr LongâContextâFineâTuning.
HGA erlaubt 16âŻ384 Token auf 16âGB-GPU, steigert Durchsatz, erhĂ€lt Ă€hnliche QualitĂ€t.
Weiterlesen
arXiv AI Papers
DreamerV3, DIAMOND, TWISTER, Simulus, STORM im Atari Pong scheitern.
FĂŒnf Weltmodelle in AtariâPong zeigen gravierende Fehler, ZeroâShotâMBRLâPolitiken schlagen Originalagenten.
Weiterlesen
arXiv AI Papers
DOE startet GenesisâMission: KI industrialisiert Forschung.
KI wird Wissenschaft von Werkzeug zu Partner, doch Autor*innen warnen vor sieben wesentlichen Risiken.
Weiterlesen
arXiv AI Papers
MedFailBench: Offene Benchmark fĂŒr Sicherheit von medizinischer KI.
MedFailBench ist ein von Klinikern erstelltes KIâSicherheitsbenchmark mit 44 annotierten FĂ€llen, LiveâLeaderboard und automatisierter ScreeningâPipeline.
Weiterlesen
arXiv AI Papers
Google Gemini fĂŒhrt bei Bewertung wissenschaftlicher Visualisierungsmodelle.
Gemini ĂŒbertrifft Menschen, Open-Source bleibt darunter; StĂ€rken: Illustration, Suche, rĂ€umliche Analyse; SchwĂ€chen: Textur, Integration, QuantitĂ€t.
Weiterlesen
arXiv AI Papers
Item Response Theory in Frage: Bewertung von LLMs mit statistischen Modellen.
Studien zeigen: klassische SchĂ€tzverfahren fĂŒr groĂe LLMâBenchmarks unpraktisch, skalierbare Modelle fĂŒr kleine Gruppen unzuverlĂ€ssig.
Weiterlesen
arXiv AI Papers
Plover: planzentrierte visuelle GUIâAutomatisierung ermöglicht Supervision.
Plover ist ein visuelles, planorientiertes GUI-Automatisierungssystem, das PlĂ€ne als prĂŒfbare Artefakte darstellt und Sprache unterstĂŒtzt.
Weiterlesen
arXiv AI Papers
LLM-gestĂŒtzte Plattform erklĂ€rt Depressionssymptome gemÀà DSMâ5âTR.
LLM-basiertes Framework verbessert depressive Diagnostik durch transparente, konsistente Labels und Feedbackschleifen.
Weiterlesen