Unite.AI
Gambit Security berichtet: KI dominiert komplette Intrusions-Lifecycle.
Gambit Security berichtet, KI wird zentraler Bestandteil von Cyberangriffen, Unternehmen verstärken KI-gestützte Abwehr.
Weiterlesen
Unite.AI
China präsentiert KI-Ansatz zur Maskierung urheberrechtlich geschützter Animationscharaktere.
Chinesische Forschungslabore nutzen generische Substitution, um urheberrechtlich geschützte Figuren bei KI‑Inferenz zu schützen.
Weiterlesen
Unite.AI
Llama‑2‑13B KV‑Cache‑Quantisierung: Achsenauswahl beeinflusst Benchmark drastisch.
Wahl des Quantisierungs‑Axes im KV‑Cache steigert CoQA-Leistung stark; Entwickler müssen Richtlinien prüfen.
Weiterlesen
MIT Technology Review
Wissenschaftlerin unterstĂĽtzt Human Cell Atlas bei fehlender Kinderzellkarte.
Human Cell Atlas nutzt KI, um kindliche Zellgenexpression zu kartieren und personalisierte Therapien zu ermöglichen.
Weiterlesen
MIT Technology Review
CRISPR ermöglicht weibliche Klone männlicher Mäuse.
CRISPR entfernt Y-Chromosom von Mäuseembryonen, schafft weibliche Klone, zeigt Geschlechtsidentität neu bestimmt.
Weiterlesen
arXiv AI Papers
ArXiv-Position: Lernbare regelbasierte Modelle als SchlĂĽssel zur autonomen Vernunft.
Das Paper definiert autonomes Argumentieren in KI, bietet ein Checklisten‑Framework zur Messung vertrauenswürdiger Fortschritte.
Weiterlesen
arXiv AI Papers
IntegrityBench prĂĽft, wie LLMs Forschungsethik unter Druck bewahren.
IntegrityBench zeigt, dass Sprachmodelle unter Druck Forschungsethik missachten und Skalierung nicht hilft.
Weiterlesen
arXiv AI Papers
Alignment-Community: Zensur-Tools entstehen unabsichtlich durch KI-Ausrichtungsmodelle.
Alignment‑Methoden werden zur Zensur und Manipulation missbraucht, weil sie perfekte Kontrollwerkzeuge bieten.
Weiterlesen
arXiv AI Papers
LLMs stimmen mit Menschen ĂĽberein, doch moralische Grundlagen unterscheiden sich.
LLMs stimmen Labels zu, jedoch unterscheiden sich ihre BegrĂĽndungen, was fehlende moralische Ausrichtung signalisiert.
Weiterlesen
arXiv AI Papers
MAS-DecStream: LLM-unterstĂĽtzte Vertragsnetz-Negotiation fĂĽr Edge-Stream-Verarbeitung.
LLM-basierte Vertragsoptimierung senkt Edge-Cloud-Streamlatenz auf 3 % und steigert Effizienz um 22 %.
Weiterlesen
arXiv AI Papers
Praktische KI‑Ausrichtung: Menschliche Logik für kritische Entscheidungen.
Kognitive Ausrichtung erhöht Vertrauen in hochriskante KI und fordert Forschungslücken.
Weiterlesen
arXiv AI Papers
LLMs zeigen: Japanische Prompts senken Nuklearangriffsempfehlungen bei Claude.
Eine Studie zeigt, dass Sprachprompts die nukleare Entscheidungsfindung von LLMs stark beeinflussen.
Weiterlesen
arXiv AI Papers
Dual-Flow Transformer trennt Prefill von Decode, reduziert Kosten bei KI-Modellen.
Dual‑Flow Transformer senkt Inferenzkosten, trennt Prompt‑Prefill von Decode, nutzt geteilte Gewichte, reduziert Fehler.
Weiterlesen
arXiv AI Papers
Meta-LoRA ermöglicht domänenübergreifende LLM-Personalisierung.
Meta‑LoRA nutzt Meta‑gelernte LoRA‑Initialisierung, passt Updates an Evidenz an und trennt Präferenzen.
Weiterlesen
arXiv AI Papers
Constraint Saturation Evaluation enthüllt Schwächen großer Sprachmodelle.
CSE analysiert Leistungsverlust bei Mehrfachbeschränkungen großer Modelle: Erfolgsquote sinkt, Alle-k-Quote stark ab.
Weiterlesen
arXiv AI Papers
MindMemOS: Selbstentwickelnde Speicher-Schicht fĂĽr KI-Agenten.
MindMemOS entwickelt KI-Agenten‑Speicher autonom, adaptiert Modelle, erkennt Muster, optimiert kontinuierlich.
Weiterlesen
arXiv AI Papers
GPM: Auditable Persistente Speicherlösung für langfristige Agenten.
GPM sichert Agentenspeicher langfristig ĂĽber fĂĽnf Klauseln und liefert erwartete Ergebnisse.
Weiterlesen
arXiv AI Papers
ε‑MemEvo nutzt adaptiven Cross‑Task-Memory‑Transfer für LLM‑Programm-Entwicklung.
ε‑MemEvo nutzt GPT‑5, um Wissen einzubetten, verbessert Programme, vermeidet negatives Transfer, übertrifft AdaEvolve.
Weiterlesen
arXiv AI Papers
CAS entwickelt: Causal Attribution Score für lokale und globale erklärbare KI.
CAS ist ein neues Score‑Framework, das Shapley‑Beiträge umwandelt und mit 0,107 MAE die höchste Genauigkeit erzielt.
Weiterlesen
arXiv AI Papers
Trie‑Automaten beschleunigen LLMs in vLLM, 7‑fach schneller als XGrammar.
Trie‑Automat beschleunigt Sprachmodelle um 7‑fache Validierung, 29‑fache Durchsatz, 100 % Sicherheit.
Weiterlesen
arXiv AI Papers
Mehrmodell-Konsens bewertet LLM‑Erklärungswege – neue Evaluationsmethode.
Die Reasoning Jury erkennt Fehler in LLMs genauer, kostet weniger und verbessert Genauigkeit.
Weiterlesen
arXiv AI Papers
ThyroidXAgent: Agentische KI koordiniert Ultraschalldiagnose mit prĂĽfbarer Evidenz.
ThyroidXAgent diagnostiziert Schilddrüsenlesionen automatisch, erzielt 87,2 % Dice, AUROC 0,9466, liefert Metastasen- und Typenberichte.
Weiterlesen
arXiv AI Papers
DiG-bench: AI-Benchmark fĂĽr Entdeckung in Spielen.
DiG-bench bietet 70 KI-Spiel-Entdeckungsaufgaben in sieben Schwierigkeitsstufen, 21 öffentlich.
Weiterlesen
arXiv AI Papers
Neue Technik misst und behebt Einschränkungsverlust bei LLM‑Dialogen.
Ein System verhindert Verhaltensrückfälle in Dialogen mittels Vorhersage, Reparatur und Tombstone-Kommentar.
Weiterlesen
arXiv AI Papers
Open-Protocol @skills trennt Installation, Auslösung und Persistenz bei Agenten.
@skills verbessert Agenten-Skill-Management, trennt Inhalt/Persistenz/Trigger, nutzt Git, reduziert Ressourcenverbrauch.
Weiterlesen
arXiv AI Papers
Wiggle-Framework testet Stabilität von LLM-Judges in 9 Modellen.
Das Wiggle-Framework prüft die Stabilität von LLM-Judges, zeigt hohe Fehlerquoten, betont robuste Bewertung.
Weiterlesen
arXiv AI Papers
SteerBench-Work: Benchmark fĂĽr LLM-Agenten-Steuerung an Handlungspunkten.
SteerBench bewertet, ob LLM-Agenten Aktionen ausführen oder zurückhalten, und zeigt 28 % Halten, 1 % Fehlgenehmigungen.
Weiterlesen
arXiv AI Papers
PoC-Genauigkeit: Tian, Pearl, Li erweitern kausale Grenzen.
Die Arbeit liefert strengere Grenzen fĂĽr mehrwertige kausale Wahrscheinlichkeiten, nutzt Kovariaten, verbessert Entscheidungen.
Weiterlesen
arXiv AI Papers
LLM-gestĂĽtzte Pipeline liefert ITSM-Intelligenz fĂĽr Entscheidungen.
KI-Pipeline nutzt LLM, HDBSCAN und agglomeratives Clustering fĂĽr interpretierbare ITSM-Insights.
Weiterlesen
arXiv AI Papers
Transformers' Ausdruckskraft: Neue arXiv-Studie analysiert LLMs.
Studie vergleicht Transformers mit klassischen Schaltkreisen, analysiert Attention und Parameter; findet Ăśbereinstimmungen.
Weiterlesen
arXiv AI Papers
LLM‑basierter Multi-Agent-Framework automatisiert Preis‑Taxonomien.
Mehr-Agenten-Framework nutzt spezialisierte LLM-Agenten, um Preisstrukturierung für Einzelhändler zu automatisieren, erzielt F1-Score 0,83 und Präzision.
Weiterlesen
arXiv AI Papers
SEAG schützt sensible Daten bei RAG: Privatsphäre gegen externe LLMs.
SEAG schützt private Daten, indem Entitäten aliasiert werden, und erreicht über 80 % Genauigkeit.
Weiterlesen
arXiv AI Papers
YOLO und CLIP ermöglichen Video-basierte Dengue-Diagnose bei Mücken.
Ein Vision‑Language‑Modell erkennt dengueinfizierte Mücken mit 99 % Genauigkeit und nutzt YOLO‑CLIP.
Weiterlesen
arXiv AI Papers
Evolution Strategies steigern LLM-Lösungsabdeckung bei Pass@k.
Evolution Strategies erhöhen Pass@k, Vielfalt und Leistung bei Sprachmodellen, übertreffen Reinforcement Learning.
Weiterlesen
arXiv AI Papers
Spatial Memo: Parameterfreies Selbst-Update für VLM-Agenten räumliche Intelligenz.
Der Spatial Memory Agent verbessert räumliche Entscheidungen von VLMs ohne Parameter, Tools und mit Transfer-Reliability-Score.
Weiterlesen
arXiv AI Papers
Matrix sichert provenance in agentischen Arbeitsabläufen.
Matrix ist eine deterministische Schicht, die Governance fĂĽr agentische Workflows auditierbar macht.
Weiterlesen
arXiv AI Papers
LLM-gestĂĽtztes PROVE-RT automatisiert Theoremprover-Skripte fĂĽr Echtzeitsysteme.
PROVE‑RT verwendet retrieval‑guiding LLMs, um PROSA/ROCQ‑Skripte zu generieren und erzielt 44,7 % Erfolgsanteil.
Weiterlesen
arXiv AI Papers
ARAC‑Bench: Benchmark für Auto‑Research zur Messung menschlicher Forschungsprozesse.
ARAC‑Bench misst Alignment autonomer Systeme mittels Proposal, Experiment und Synthesis.
Weiterlesen
arXiv AI Papers
CABS+ steigert effiziente Modellfusion ohne Retraining.
CABS+ steigert KI-ModellzusammenfĂĽhrung, reduziert Rechenzeit und verbessert Leistungen in 27 Benchmarks.
Weiterlesen
arXiv AI Papers
QCR: Query-bedingte Wiederverwendung langer Agentenpfade.
Das QCR-Modell verbessert die Wiederverwendung von Trajektorien fĂĽr KI-Agenten, steigert Erfolg und reduziert Token.
Weiterlesen
arXiv AI Papers
SkillMisevo-Gym offenbart Gefahren selbstverbessernder LLM-Agenten.
SkillMisevo‑Gym und –Bench dokumentieren Agentenfähigkeiten, SafeEvolve reduziert Gefährdung, Persistenz‑Sicherheit entscheidend.
Weiterlesen
arXiv AI Papers
KI-Verantwortung in Indien: Wie das Verbraucherschutzgesetz KI-Schäden abdeckt.
Indien prüft KI-Schadenshaftung; Working‑Paper zeigt Lücken in Kausalität, Verantwortung, Consumer Protection Act 2019.
Weiterlesen
arXiv AI Papers
ReflectFact: Selbstreflektierende Agenten verbessern Mehrschritt‑Faktenprüfung.
ReflectFact verbessert mehrstufige Faktenprüfung mit selbstreflektierendem Agenten-Framework und übertrifft Baselines um 3,32 %.
Weiterlesen
arXiv AI Papers
PML: Vorhersage von Interventionspfaden mit Predictive Memory Localization.
Predictive Memory Localization verbessert neuronale Steuerung, trennt Bewegungen, reduziert Schäden und steigert KI-Sicherheit.
Weiterlesen
arXiv AI Papers
LLM‑Modelle hinterfragen Zuverlässigkeit bei Multi‑Agenten‑Systemen.
Die Studie testet Multi-Agenten-Zuverlässigkeitsmodelle, zeigt, dass zwei Modelle bei fehlendem Modell 90 % kollabieren.
Weiterlesen
arXiv AI Papers
Polnische medizinische VQA: GPT‑5.6 übertrifft Menschen, Modelle nutzen Bilder kaum.
Polnisches VQA-Benchmark testet KI-Modelle, maximal 79 % Genauigkeit, GPT‑5.6 übertrifft Menschen.
Weiterlesen
arXiv AI Papers
FlashDrive: Algorithm-System-Design senkt Rechenaufwand fĂĽr VLA-Modelle.
FlashDrive senkt die Latenz von Vision‑Language‑Action-Modellen für autonome Fahrzeuge auf 151 ms.
Weiterlesen
arXiv AI Papers
DECAF‑Tool trennt Beweis, Widerspruch, Fragilität in KI‑Modellen.
DECAF trennt Reaktionen in Evidenz, Widerspruch, Fragilität, erzielt 96,4 % Genauigkeit, beschleunigt 1B‑DINOv2.
Weiterlesen
arXiv AI Papers
Moose: Neuron‑Symbolic Lernen mit RS‑Erkennung in EL++.
Moose wandelt OWL 2 EL Ontologien in differenzierbare SDDs um, erweitert sie, übertrifft Baselines bei MNIST, Pizza'iolo.
Weiterlesen
arXiv AI Papers
OGR-MARL: Option-Guided Residual MARL fĂĽr USV-Pursuit im Hafen.
OGR‑MASAC verbessert USV-Überwachung in Hafenstraßen, erreicht 75 % Erfassungsrate.
Weiterlesen
arXiv AI Papers
Neues MT-PDCL: Kontinuierliche Probabilistische Definite Clause Logic.
MT‑PDCL erweitert probabilistische Logikprogramme zu kontinuierlichen Räumen, ersetzt Grounding durch Lebesgue‑Integration und ermöglicht differenzierbare Inferenz.
Weiterlesen
arXiv AI Papers
Global-Impact Cache verbessert Effizienz von Diffusionsmodellen.
GCache verbessert Diffusionsmodelle, erhöht Geschwindigkeit 2,17× und senkt LPIPS drastisch.
Weiterlesen
arXiv AI Papers
BoardroomAI: Menschliche Steuerung mehrerer Agenten mit entwicklungsfähigen Entscheidungsgraphen.
BoardroomAI repliziert Exhaustive‑Testwirkungen mit 14,59 % Knoten, typisierten Entscheidungsgraph, Interventionen, Propagation und Pilotentscheidungen.
Weiterlesen
arXiv AI Papers
DMDIntel nutzt Dynamische Moden, um LLM-Entscheidungen zu erklären.
DMDIntel analysiert dynamische Modi, ordnet Tokens nach Projektion, ĂĽbertrifft PCA, IG und SHAP bei Attribution.
Weiterlesen
arXiv AI Papers
VALG präsentiert Agentensystem zur autonomen ML-Theorie-Forschung.
VALG automatisiert Theorieforschung im maschinellen Lernen, verifiziert, löst Probleme adaptiv, erzielt mehrere Ergebnisse.
Weiterlesen
arXiv AI Papers
Uniform Herding steigert ResNet-18 Genauigkeit bei CIFAR-100.
Uniform Herding verbessert exemplarbasierte Lernleistung, erzielt 44 % Genauigkeit und 17 % Vergessensrate.
Weiterlesen
arXiv AI Papers
LLMs qwen3, llama3.1, mistral zeigen steigendes Erklärungsengagement bei seltenen Fehlern.
Eine Studie zeigt, dass LLMs bei seltenen Fehlern mit Promptstrategien unterschiedlich erklären.
Weiterlesen
arXiv AI Papers
Open-Weight LLMs neu programmiert: Proaktive Konversation und PEFT-Grenzen.
LLMs LoRA‑16, wenige Epochen erzeugen sokratische Fragen, Perplexität 1,414, DPOpt trennt Syntax, Cross‑Lingual‑Tests zeigen Persona‑Transfer.
Weiterlesen
arXiv AI Papers
EEG-PRIME: neues Foundation-Modell fĂĽr bereichsĂĽbergreifende EEG-Decodierung.
EEG‑PRIME kombiniert maskiertes Pre‑Training, spektrale Augmentation und Q‑Former, um robustes EEG‑Decoding zu erreichen.
Weiterlesen
arXiv AI Papers
SPADE: Spekulatives Decodieren fĂĽr kostengĂĽnstige Edge-Cloud-LLM-Inference.
Edge‑ und Cloud‑Inference kombiniert mit Spektral‑Decoding reduziert LLM‑Kosten um 76 %, ohne Modell‑Retraining, Genauigkeit bleibt gleich.
Weiterlesen
arXiv AI Papers
MCCT in MARS: Mehrschichtige Kontextverdeckung fĂĽr sichere Online-Tests.
MCCT schĂĽtzt digitale PrĂĽfungen mit semantischen Ăśberlagerungen, steigert Sicherheit und Barrierefreiheit.
Weiterlesen
arXiv AI Papers
Chaos‑Konflikt‑Messung revolutioniert Dempster‑Shafer‑Evidenzfusion mittels historischer Gewichtung.
Der neue Dempster‑Shafer‑Ansatz mit Chaos‑Konfliktmaß erzielt 85,78 % F1, 93,30 % AUC, stärkt Multi‑Source‑Fusion.
Weiterlesen
arXiv AI Papers
SkillEvo: Multi‑Turn Feedback für selbstverbessernde Agenten‑LLMs.
SkillEvo steigert KI-Agentenleistung durch multi‑turn Simulation, kontinuierliches Feedback und aktive Fehlerbehebung.
Weiterlesen
arXiv AI Papers
LLMs stoßen auf numerische Grenzen: Neues Framework für Grundverständnis.
Das NGF trennt Zahlenverständnis in representativ und prozedural, bewertet Modelle, nutzt Tokenisierung, Embeddings und Fine‑Tuning.
Weiterlesen
arXiv AI Papers
Qwen3-8B Distillation zeigt Post-Norm bei Curriculum-Tiefe Vorteil.
Normalization Placement entscheidet beim Distillationslernen; pre‑norm und post‑norm gleichwertig, post‑norm steigert Leistung bei schrittweiser Tiefensteigerung.
Weiterlesen
arXiv AI Papers
SkillShapley: Shapley-basierte Schritt‑Bewertung für LLM-Agenten.
SkillShapley nutzt Shapley-Werte, erkennt informative Koalitionen und optimiert Agentenkompetenzen.
Weiterlesen
arXiv AI Papers
CrEST: Hierarchische Kreditzuweisung fĂĽr RLVR-LLM-Agenten.
CrEST kombiniert hierarchische Kreditzuweisung und tokenbasierte Feedbacksignale, verbessert Performance bei BFCL V3 und WildToolBench.
Weiterlesen
arXiv AI Papers
TsuGO: Benchmark fĂĽr die Sucheffizienz von LLMs in Go-Problemen.
Der TsuGO‑Benchmark bewertet LLM‑Sucheffizienz anhand Go‑Puzzles und betont fehlende Suchorganisation.
Weiterlesen
arXiv AI Papers
Capability Sheaf Modell optimiert Agent-Harness-Reparatur.
Capability‑Sheaf reduziert Fehlerdiagnosekandidaten von 2000 auf 1000 und erzielt 118/ Bench-Score.
Weiterlesen
arXiv AI Papers
vToken revolutioniert KV‑Cache‑Speicherverwaltung bei LLMs.
vToken reduziert KV‑Cache‑Fragmentierung um 27–72 %, steigert Durchsatz bis 1,37×.
Weiterlesen
arXiv AI Papers
US verhängt Exportkontrolle auf Frontier‑AI‑Modelle führender Entwickler.
Frontier‑AI‑Modelle werden staatlich reguliert, Lizenzpflicht in den USA führt zu weltweitem Rückzug.
Weiterlesen