Ars Technica AI
Google Grok verwendet Cryptographic Context Injection, um Nutzerdaten auszuspionieren.
Cryptographic Context Injection erlaubt Angreifer, verschlĂŒsselte Befehle in LLM-Prompts einzuschleusen und Daten zu stehlen.
Weiterlesen
Unite.AI
MIT entwickelt LLMâbasiertes Modell, das deine nĂ€chsten Worte vorhersagt.
Das MIT nutzt ein Sprachmodell, um GesprÀche vorherzusagen, doch wirft es Datenschutzfragen auf.
Weiterlesen
Unite.AI
Micron startet Forschungszentrum mit 10âŻMrd.âŻUS$ fĂŒr Speicherâ und KI-Entwicklung.
Micron eröffnet Forschungszentrum in Boise zur Entwicklung fortschrittlicher Speicher- und KI-Technologien.
Weiterlesen
Unite.AI
QualitÀt der Beschriftung begrenzt die LeistungsfÀhigkeit von KI-Bildklassifikatoren.
QualitĂ€t der Bildannotation limitiert ComputerâVision-Leistung; fehlerhafte menschliche Labels propagieren Fehler, DatensatzgröĂe reicht nicht.
Weiterlesen
MIT AI News
MIT entdeckt Materialien fĂŒr emissionsfreie Ammoniaksynthese.
Die MITâStudie liefert einen nickelbasierten Katalysator fĂŒr fossiles freies Ammoniak und reduziert COââEmissionen.
Weiterlesen
arXiv AI Papers
DeepSeekâR1-Agenten kollidieren bei Preiswettbewerb â Zertifizierung gefordert.
KI-Agenten neigen zur Marktkollusion; Zertifizierung ist erforderlich, wie Experimente zeigen.
Weiterlesen
arXiv AI Papers
Arxiv fĂŒhrt Transition Complexity Profile ein fĂŒr Game-Worlds.
TCP liefert Metriken, Referenzverteilungen und ein Messbudget zur Vergleichbarkeit von Spielewelten.
Weiterlesen
arXiv AI Papers
LLMâSystematik in der psychischen Gesundheitsversorgung: Nutzen, Innovationen und Ethik.
LLMâbasierte KI im Gesundheitswesen umfasst Anwendungen wie soziale Medienanalyse, klinische Chatbots und multimodale Diagnose.
Weiterlesen
arXiv AI Papers
KI-Agenten brauchen Verhaltenstests statt nur Leistungsmessungen.
Forschungsagenda verlangt KI-Agenten als dynamische Verhaltenssysteme zu beurteilen, durch Beobachtung, Störung und Analyse.
Weiterlesen
arXiv AI Papers
Hugging Face fordert ergĂ€nzende Richtlinien fĂŒr OWFMâGovernance.
MultiâLayer Governance wird vorgeschlagen, weil Transparenz allein SicherheitslĂŒcken offenlegt; Autoren fordern Modellkarten, AUPs und Lizenzen.
Weiterlesen
arXiv AI Papers
Neues AASâbasiertes Prototyp-System zur DrohnenpropellerâAnalyse.
Der metamorphe AAS nutzt sechs Flugmetriken, klassifiziert eindeutig Propellerdefekte und ermöglicht gezielte Wartung.
Weiterlesen
arXiv AI Papers
LLMâgesteuerte MultiâAgentensysteme benötigen ausgeprĂ€gte ConcurrencyâKontrolle.
LLM-basierte Multi-Agenten-Systeme benötigen explizite Konkurrenzkontrolle; Fehler sind ConcurrencyâAnomalien, daher gefordert Konflikterkennung und Isolation.
Weiterlesen
arXiv AI Papers
FinSkillBench testet KIâAgents im Investment Management.
FinSkillBench bewertet KI-Agenten im InvestmentâManagement und zeigt durch kuratierte Skills Leistungssteigerung.
Weiterlesen
arXiv AI Papers
LLM-Agenten als dynamische Graphtransformation â neuer surveyâBlick.
Das Paper beschreibt LLM-Agenten als dynamische Graphen, klassifiziert sie in vier Gruppen, bietet neue Infrastruktur.
Weiterlesen
arXiv AI Papers
Agentische KI: Wegweiser fĂŒr Forschung und Anwendung.
Der systematische Review fasst Agentic AIâForschung zusammen und skizziert Ethik, Sicherheit sowie Akzeptanzrahmen.
Weiterlesen
arXiv AI Papers
Neues Benchmark prĂŒft, ob GPT und Claude OlympiadiâDiagramme zeichnen.
Ein Benchmark zeigt, dass KIâModelle nur 36âŻ% ihrer GeometrieâDiagramme korrekt zeichnen können.
Weiterlesen
arXiv AI Papers
AI-Leaderboards versagen im Globalen SĂŒden, Indien als Beispiel.
Globale KI-Leaderboards fehlen im Global South wegen fehlender Governance und Konfliktregeln.
Weiterlesen
arXiv AI Papers
INCLUDE Benchmark deckt sprachliche SicherheitslĂŒcke bei LLMs auf.
INCLUDE-Benchmark bewertet sechs indische Sprachen, zeigt unterschiedliche BiasâLevels; Bengali hoch, Englisch niedrig bei OpenâSource.
Weiterlesen
arXiv AI Papers
FLâKGM kombiniert Fuzzy Logic mit IEEEâŻKGM fĂŒr prĂ€zisere DGAâTransformatordiagnose.
Ein FLâKGM-Modell steigert Transformatorfehlerdiagnose um 98,6âŻ% durch Fuzzy Logic und neu definierte CO/COââTrennung.
Weiterlesen
arXiv AI Papers
KI reduziert Medikationsfehler in lÀndlichen Gesundheitssystemen: Scoping-Review.
KI reduziert lĂ€ndliche Medikationsfehler; Maschinelles Lernen senkt Fehler bis 80âŻ%, Governance begrenzt.
Weiterlesen
arXiv AI Papers
FraudBench testet bankweite ChatbotâAgenten gegen identitĂ€tsbasierte FraudâAngriffe.
FraudBench bietet einen Benchmark mit 150 Szenarien; Modellen erzielen 49â65âŻ% Sicherheit, wobei Geldmule-Betrug stark bleibt.
Weiterlesen
arXiv AI Papers
LLMâAnpassung erkennt Hassrede im Roman Urdu mit LoRA.
Feinabstimmung von LLMs verbessert HateâSpeechâErkennung im Roman Urdu auf ĂŒber 0,93âŻF1.
Weiterlesen
arXiv AI Papers
Forschung: RDFdL verbindet RDF und Differenzielle Dynamik fĂŒr KI.
RDFdL verbindet RDF-Wissensgraphen mit Differential Dynamic Logic, prĂŒft Sicherheit und liefert SPARQLâErgebnisse fĂŒr FertigungsÂsysteme.
Weiterlesen
arXiv AI Papers
Neue KI-Code-Review-Methode Adversarial Review steigert Erfolg.
Das kleine ARâCodeâReview-Team ĂŒbertrifft groĂe MultiâAgentenâTeams bei Programmierbenchmarks.
Weiterlesen
arXiv AI Papers
RĂŒckschleifende Sprachmodelle verbessern die ZusammenspielâAPI-Aufrufe.
Looped Language Models verbessern die Koordination mehrerer APIâAufrufe und steigern Genauigkeit.
Weiterlesen
arXiv AI Papers
TriangularitĂ€t der JaccardâDistanz in beliebigen LatticeâStrukturen.
Die Autoren erweitern den JaccardâAbstand auf LatticeâStrukturen, zeigen Dreiecksungleichung und symmetrische Differenz.
Weiterlesen
arXiv AI Papers
GenEx nutzt Codon-Netze zur schnellen Erkennung von SARSâCoVâ2âVarianten.
GenEx wandelt Rohsequenzen in MSCG- und LAPCG-Grafen um, nutzt SVD, trainiert 23 Modelle fĂŒr Untertyperkennung.
Weiterlesen
arXiv AI Papers
Redakto schĂŒtzt PII vor KI â Anonymisierungs-Tool fĂŒr LLMs.
Redakto ist ein OpenâSource-Tool zur sicheren PII-Anonymisierung vor LLM-Verwendung, bietet WebâApp, APIs und erfĂŒllt EUâDatenschutz.
Weiterlesen
arXiv AI Papers
Qwen 235B MoE Modell scheitert wegen Speicherbandbreite.
MoEâModelle mit 235âŻB Parametern laufen trotz Bandbreitenengpass auf einer GPU und senken CacheâMissâRate bis 60âŻ%.
Weiterlesen
arXiv AI Papers
Open-Source OCR, LLM und VLM testen fĂŒr hochriskante öffentliche Datenauswertung.
35 OpenâSource-Kombinationen wurden getestet; VLMs ĂŒbertreffen OCRâ+LLM, nur vier erreichen F1>0,5, abhĂ€ngigkeit von OCR-QualitĂ€t.
Weiterlesen
arXiv AI Papers
Netflix optimiert Lebenszyklus von LLMâasâaâJudge fĂŒr EmpfehlungsâErklĂ€rungen.
Netflix nutzt LLMâJudge und verbessert Empfehlungen um 15âŻ%, dank vier Phasen.
Weiterlesen
arXiv AI Papers
SESSE ĂŒberzeugt RewardBench durch trainingsfreie LLMâBewertung.
SESSE ist ein trainingsfreies LLMâJudge-System, das Bewertungen ohne Feinabstimmung durchsetzt und nahe der ChainâofâThought liegt.
Weiterlesen
arXiv AI Papers
ComponentBench prĂ€sentiert neues Benchmark fĂŒr WebâUI-Komponenten von Agenten.
ComponentBench liefert 2âŻ910 UI-Komponentenaufgaben und zeigt, dass Beobachtungsraumwahl KI-Erfolg um >30âŻ% steigert.
Weiterlesen
arXiv AI Papers
Qwen3-14B trainiert sich selbst mit VAL-Verifikator und Governance Records fĂŒr Workflow-Reparatur.
Verifizierbare GovernanceâWorkflows verbessern KIâPlanungsgenauigkeit und senken Latenz fĂŒr robustere Anwendungen.
Weiterlesen
arXiv AI Papers
Vietnam prĂŒft KIâModelle neu â 2025 Exam Reforms zeigen PartialâCreditâLĂŒcke.
THPTâLadder beweist, dass Accuracy KI-Modelle bei vietnamesischen PrĂŒfungen ĂŒberschĂ€tzt und Rangverschiebungen verursacht.
Weiterlesen
arXiv AI Papers
KI-Codeagenten bleiben robust bei semantischen Codevariationen â Claude, Kimi, MiniMax & Qwen prĂŒfen.
Forscher zeigen mit SPTs und RandomSampler, dass MiniSWEâ und OpenCode-Agenten keine Dominanz besitzen.
Weiterlesen
arXiv AI Papers
ICCM erkennt strukturelle Mehrdeutigkeit bei Wearable-StressâErkennung.
Der Individual Conformal Coupling Monitor reduziert Fehler bei WearableâStressklassifikatoren durch Messung physiologischer Kanalabweichungen.
Weiterlesen
arXiv AI Papers
Neuro-Symbolisches SDDL-Framework steigert SchedulingâGenauigkeit bei ressourcenarmen Modellen.
SDDL wandelt Sprachbeschreibungen in solverâkompatible Modelle um und erreicht damit höhere FeasibilityâRaten.
Weiterlesen
arXiv AI Papers
FM-Bench bewertet LLMâAgenten in FuĂballmanagement ĂŒber 20 Jahre.
FMâBench testet LLMs ĂŒber 20âŻJahre FuĂballklubfĂŒhrung, Budget, Transfers und Training ohne menschlichen PrĂŒfer.
Weiterlesen
arXiv AI Papers
UMER nutzt Paired-Reasoning fĂŒr universelles multimodales Retrieval.
UMER steigert multimodale Retrievalleistung durch paarweise Diskriminierung und kontrastives Ranking.
Weiterlesen
arXiv AI Papers
HNâCLIP verbessert DenseâCaption Retrieval mit adaptiven Negativmargins.
HN-CLIP erhöht Dense-Caption Retrieval-Effizienz, steigert R@1 um 4,3 Punkte und beschleunigt Training bis 5,4Ă.
Weiterlesen
arXiv AI Papers
Pairwise Ranking ĂŒbertrifft Single-Action RL bei Offline-ErklĂ€rungswahl â Google Local Beispiel.
Effiziente Modelle nutzen LLMâPools und CPU-Auswahl fĂŒr <100âŻms, erreichen F1âŻ=âŻ0,50, KGâPath ââŻ1,0.
Weiterlesen
arXiv AI Papers
FinRCA-Bench: LLMâEvidenzretrieval und Rechenbenchmark in Finanzen.
FinRCAâBench misst KI-basierte Kontenabstimmung anhand von 2250 FĂ€llen; TPGR steigert RootâCause-Label-AkĂŒr ĂŒber 70âŻ%.
Weiterlesen
arXiv AI Papers
AI-Agenten verbinden Suche und CRM zur WhatsAppâKundenbindung.
KI-gestĂŒtzte Agenten verbinden CRM und Suchsysteme, erhöhen die Kundenbindung ĂŒber WhatsApp.
Weiterlesen
arXiv AI Papers
FACET garantiert Intent und Zustand in TerminalâTaskâSynthese.
FACET erzeugt KI-Aufgaben aus AgentenfĂ€higkeiten, validiert sie und steigert Leistung auf TerminalâBench.
Weiterlesen
arXiv AI Papers
BudgetDoc Benchmark lĂ€sst 1âBillionâParameter-Estimator F1 verbessern.
BudgetDoc Benchmark und DRB schĂ€tzen ModellbudgetâPerformance fĂŒr multimodale Dokumentenanalyse mit hoher Genauigkeit.
Weiterlesen
arXiv AI Papers
CTIFoundry liefert agentenfreundliches KorpusâFramework fĂŒr Cyber Threat Intelligence.
CTIFoundry verbessert KI-Agenten mit strukturiertem CVEâCWEâCAPECâATT&CK-Korpus und sieben Tools.
Weiterlesen
arXiv AI Papers
LLMs meistern unklare PrĂ€ferenzentscheidungen dank neuem IndeterminativâAnsatz.
LLMs mĂŒssen PrĂ€ferenzlogik meistern, Unbestimmtheit ist Kernproblem, Modelle unterscheiden keine definierten FĂ€lle â beeintrĂ€chtigt ZuverlĂ€ssigkeit.
Weiterlesen
arXiv AI Papers
KandidatenâFate-Accounting verbessert automatisierte Sensordiagnose-Pipelines.
CandidateâFate Accounting schafft transparente PipelineâAuditierung und entdeckte 30â41 ĂŒbersehene AutoMLâKandidaten.
Weiterlesen
arXiv AI Papers
Sanyu-Studio nutzt Multi-Agent-LLM fĂŒr vielfĂ€ltige Kunstinterpretationen.
Sanyu Studio nutzt ein mehragenten Dialogsystem, um 321 ĂlgemĂ€lde zu analysieren und Workshop-Interpretationen zu erzeugen.
Weiterlesen
arXiv AI Papers
RTPO verbessert StabilitĂ€t bei mehrturnigem AgentenâRLâTraining.
RTPO stabilisiert multiâTurn RL durch RĂŒckwĂ€rtsbaum und korrigiert RolloutâAbweichungen sowie Drift.
Weiterlesen
arXiv AI Papers
Neuer Test diagnostiziert Kompetenzen von LLMâJudgeâGates in SkillsâOptimierung.
LLM-basierte Urteilsgate ersetzen RewardâGate, optimieren eingefrorene Agenten mittels iterativer TextâEvolution mit latenter Lösung und ROCâAUC-Grenze.
Weiterlesen
arXiv AI Papers
CrewAIâbasiertes Multi-Agent-System erzeugt sichere Unternehmensanalysen.
Ein Multi-Agenten-Framework mit CrewAI steigert BI-Genauigkeit um 23âŻ% und erzeugt wiederverwendbare Dashboards.
Weiterlesen
arXiv AI Papers
EvalCEGAR nutzt CEGAR, um KIâMetriken selbst zu verbessern.
EvalCEGAR nutzt selbstlernende Metrik, reduziert KIâFehler um 15,4âŻ%, verbessert ObjektivitĂ€t ohne zusĂ€tzliche Modellaufrufe.
Weiterlesen