Ars Technica AI
AlphaFold von Google gestaltet CRISPR-Proteine sicherer.
AlphaFold optimiert Cas9, reduziert OffâTarget ohne Effizienzverlust.
Weiterlesen
MIT AI News
PhD-Studentin automatisiert Nuklearkraftwerke dank Navy-Erfahrung.
Lauren Fortier entwickelt KI-gestĂŒtzte Automatisierung fĂŒr Kernkraftwerke, um Wartung und Sicherheit zu erhöhen.
Weiterlesen
MIT Technology Review
Technik zur 24âStundenâWiederbelebung von Organen.
Ich entschuldige mich, habe keinen Zugriff, erstelle gern Zusammenfassung, wenn Sie Text bereitstellen.
Weiterlesen
MIT Technology Review
SuperkĂŒhlte Nieren transplantiert, chinesische Chips dominieren Halbleitermarkt.
Univ. X und Y hielten Nieren bei -180âŻÂ°C, transplantierten sie in Schweine, erzielten Rekordlagerzeit.
Weiterlesen
arXiv AI Papers
AINTMA: Autonome Testverwaltung mit KI und generativer QualitÀt.
AINTMA nutzt sechs spezialisierte Agenten fĂŒr autonomes SoftwaretestâManagement auf CloudâNativeâMikroservices mit Zero-Trust-Kommunikation, um Priorisierungskorrektheit sicherzustellen.
Weiterlesen
arXiv AI Papers
LLM-Watermarks auf Medizintexten: Systematisches Benchmarking von 11 LLMs und 7 VLMs.
LLMâWatermarking erschwert medizinische Modellleistung, zeigt Fehler, erfordert domĂ€nenspezifische Tests.
Weiterlesen
arXiv AI Papers
Stochastisches Sampling bleibt flach: Dimensionengap zwischen Temperatur und LLM-Ensemble.
Die Studie vergleicht Selbstkonsistenz und Ensemble von LLMs; letztere liefert strukturierte UnsicherheitsabschÀtzungen, der erste keine.
Weiterlesen
arXiv AI Papers
Google Cloud TPUs starten JAXBench, Benchmark fĂŒr KI-Modelle.
Google fĂŒhrt JAXBench ein, ein TPU-Benchmark mit 50 Workloads, erzielt signifikante Speed-ups und höhere Genauigkeit.
Weiterlesen
arXiv AI Papers
DC-Leap beschleunigt Diffusions-Sprachmodelle ohne Training.
DCâLeap beschleunigt Diffusions-LLMs ohne Retraining, erreicht bis zu 105âfach Geschwindigkeit ohne QualitĂ€tsverlust.
Weiterlesen
arXiv AI Papers
InferenceBench: Benchmark fĂŒr KI-Agenten zur LLM-Optimierung mit OpenAI-Server und NvidiaâH100.
InferenceBench bewies, dass KIâAgenten die AusfĂŒhrungsgeschwindigkeit von LLMs signifikant erhöhen, jedoch hinter HyperparameterâSuchen zurĂŒckbleiben.
Weiterlesen
arXiv AI Papers
DecodeShare identifiziert gemeinsamen Subraum im LLM-Decoding.
DecodeShare identifiziert einen gemeinsamen Subspace in LLM-Decodes, dessen Entfernung die Modellleistung stark beeintrÀchtigt.
Weiterlesen
arXiv AI Papers
PlanE: Optimiertes Planen fĂŒr datenbasierte LLMs mit DTI.
PlanE kombiniert Datenzerlegung, InstructionâTuning und PromptâInference fĂŒr effizientere, annotierungsarme Modellanpassung.
Weiterlesen
arXiv AI Papers
LLMs auf PersonalisierungsfĂ€higkeit geprĂŒft.
SDRâBench zeigt, dass generative LLMs keine Unterschiede zwischen erfolgreichem und erfolglosem Outreach erkennen.
Weiterlesen
arXiv AI Papers
DCGS-Framework sichert LLMs gegen mehrfache Angriffe ab.
DCGS verbessert LLM-Sicherheit, bewertet missbrĂ€uchliche Eingaben und ĂŒbertrifft bestehende Modelle ohne Feinabstimmung.
Weiterlesen
arXiv AI Papers
IPJ: UnvollstÀndige Prompts lassen LLMs schÀdliche Texte generieren.
LLMs generieren gefÀhrliche Antworten bei unvollstÀndigen Prompts, Forschung schlÀgt neuronale Filter vor.
Weiterlesen
arXiv AI Papers
VeriSimpl: LLMâgestĂŒtzte Optimierungsformulierung mit Verifikation.
VeriSimpl verbindet LLMs und OptimierungsâSolver, ĂŒbersetzt Textprobleme und prĂŒft sie prĂ€ziser.
Weiterlesen
arXiv AI Papers
SonicSampler: Einheitliche TritonâKerne fĂŒr dynamisches LLMâSampling.
SonicSampler beschleunigt LLMâSampling bis zu 16âŻĂ durch TritonâKernels und einen hierarchischen TopâkâAlgorithmus.
Weiterlesen
arXiv AI Papers
LLM-Benchmark: Mehrsensor-Fehler werden von ChatGPT, Gemini, DeepSeek, Kimi, Llama ĂŒbersehen.
KI-Modelle unterschĂ€tzen multisensorische Gefahren: sie warnen bei Einzelsensoren, aber nicht bei kombinierten Ăberschreitungen.
Weiterlesen
arXiv AI Papers
Semiâsupervised Distillation verbessert Skalierbarkeit von Textâattributierten Graphen fĂŒr LLMs.
Algorithmus \algo{} verbessert skalierbares Lernen von Text-Attributierten Graphen mittels Wasserstein-Distanz, Dual-Encoder und kollaborativem Self-Training.
Weiterlesen
arXiv AI Papers
LLMâLĂŒgen erkennen: Tiefe, Typologie und Sparsity beeinflussen Probes.
Studie zeigt, dass Trainingsdaten und Typologie entscheidend sind; optimale Tiefe hÀngt vom Datensatz ab.
Weiterlesen
arXiv AI Papers
Skalierbare Mehrquellenanalyse optimiert Stromnetz-Topologie.
ArXivâŻ2607.20480: ConstrainedâInferenceâFramework verbessert Topologieerkennung, erreicht 95âŻ% Genauigkeit, reduziert Rechenaufwand, hilft Unternehmen.
Weiterlesen
arXiv AI Papers
Training-freies Routing: CARGO entscheidet per Vertrauen, wann LLM-Cloud genutzt wird.
CARGO ermöglicht effiziente lokale-Cloud-Kollaboration, indem es Inferenzantworten abstimmt und dynamisch lokale Modelle oder Cloud-LLMs nutzt.
Weiterlesen
arXiv AI Papers
PersonaTrail: Benchmark fĂŒr personalisierte Webagenten anhand realer SurfverlĂ€ufe.
PersonaTrail ist ein Benchmark, der reale SurfverlÀufe nutzt, um KI-Agenten zur PrÀferenz-Erfassung zu testen.
Weiterlesen
arXiv AI Papers
LLMs mit LR(k)-Grammars gewÀhrleisten syntaktisch korrekte Ausgabe.
Neue Methode bindet LLMs an LR(k)-Grammatiken, prĂŒft Compliance polynomiell, ermöglicht syntaktisch korrekten Code.
Weiterlesen
arXiv AI Papers
Neues Verfahren TRSP verhindert ReprÀsentationscollapse bei LLMs.
TRSP verbessert Langkontextleistung von LLMs, erreicht 83âŻ% Genauigkeit, ĂŒbertrifft andere Modelle.
Weiterlesen
arXiv AI Papers
ExpectBench: Benchmark fĂŒr echte Benutzererwartungen bei LLMs.
ExpectBench bewertet echte Nutzererwartungen, zeigt LLM-Abweichungen, LENS modelliert latente WĂŒnsche.
Weiterlesen
arXiv AI Papers
OPTScientist: Multi-Agent Suche nach Typenoptimierern fĂŒr Transformer-Vortraining.
OPTScientist ist ein mehragentenbasiertes, theoriegeleitetes KI-System zur automatischen Optimiererentwicklung mittels DSL und evolutionÀrer Suche.
Weiterlesen
arXiv AI Papers
OpenAI GPTâ4 und Meta LLaMA zeigen ideologische Halluzinationen bei QBias NewsâLLM QA.
Studie zeigt, dass LLM-Halluzinationen bei politischen Fragen linksgerichtet sind, basierend auf 21.727 US-Nachrichten.
Weiterlesen
arXiv AI Papers
ATM: SelbstĂ€ndige TopologieĂ€nderung sichert Laufzeit-Neustrukturierung von Multi-AgentâLLM.
Autonomous Topology Mutation dynamisiert LLM-Frameworks, steigert Erfolg 61,7âŻ% und eliminiert Datenschutzverletzungen.
Weiterlesen
arXiv AI Papers
EvoSQL: MemoryâAugmented TextâzuâSQL mit CoâEvolution und SelfâDistillation.
EvoSQL verbessert SQL-Abfragen durch CoâEvolution, SelfâDistillation und zeigt bei BIRDâDev deutliche Leistungssteigerungen.
Weiterlesen
arXiv AI Papers
CRAWO: Adaptive Edge-Orchestrierung fĂŒr KI-Pipelines.
CRAWO trennt Auftragsintelligenz von AusfĂŒhrung, reduziert Latenz und Cloud-AbhĂ€ngigkeit fĂŒr Echtzeit-Smart-City-Anwendungen.
Weiterlesen
arXiv AI Papers
DFAH-Bench enthĂŒllt EntscheidungsinstabilitĂ€t bei Finanzagenten.
DFAHâBench bewertet Agentenverhalten: 95âŻ% EntscheidungssynchronitĂ€t, 77âŻ% Pfadkonsistenz, 18âŻ% Gap, 3 Profiltypen.
Weiterlesen
arXiv AI Papers
Neues Attention-basiertes Replay-Framework verbessert kontinuierliches Zeitreihenforecasting.
Neues Framework fĂŒr kontinuierliches ZeitreihenâForecasting reduziert catastrophisches Vergessen, nutzt Replay, Attention und statische Methoden.
Weiterlesen
arXiv AI Papers
Google Gemini-2.5-Flash ohne Regex ĂŒberwindet adversarial Mutationen.
Studie zeigt, Regex-Filter verhindern LLM-Fehler nicht; Modell-Alignment wirkt nur bei speziellen Metriken.
Weiterlesen
arXiv AI Papers
Neues, WorkloadâBewusstes Caching senkt Latenz in MultiâAgentâSystemen.
WorkloadâAware Cache Eviction senkt Latenz um bis zuâŻ64,7âŻ% bei MultiâAgentâSystemen und verbessert Genauigkeit.
Weiterlesen
arXiv AI Papers
Ergo: Fehlergetriebene Prompt-Optimierung verbessert Textklassifikation.
ERGO verbessert Textklassifikation durch Fehlerdiagnose, dominiert Benchmarks, erzielt 90âŻ% TREC, 94,4âŻ% CLINC150.
Weiterlesen
arXiv AI Papers
AISE-Bench: LLM-basiertes Benchmark fĂŒr akademische Wissensgraphen.
AISEâBench bietet 1âŻ133 QAâPaare und vollstĂ€ndige APIâTrajektorien, bewertet 14 Modelle, zeigt moderate Leistungen.
Weiterlesen
arXiv AI Papers
ExecuGraph: Multi-Agent-Framework mit LangGraph und Ollama fĂŒr Backend-Code.
ExecuGraph steigert Codegenerierung durch Agentenkoordination, lokale Modelle, Sandbox, bis zu 22,5âŻpp Genauigkeit.
Weiterlesen
arXiv AI Papers
FlowEdit: LLMâKontrolle fĂŒr Konfliktaufgaben mittels Informationsprinzipien.
FlowEdit steuert LLMs mithilfe informationstheoretischer Ziele, verbessert SatzâĂbereinstimmung um 68âŻ% und Antwortinformatik um 24âŻ%.
Weiterlesen
arXiv AI Papers
MKEvolve: LLM-getriebenes modularâframework fĂŒr PyTorchâKernelâCodegeneration.
MKEvolve nutzt Sprachmodelle, zerlegt PyTorchâModule, optimiert separat und liefert kompakte, verifizierte Kernels, die Tests ĂŒbertreffen.
Weiterlesen
arXiv AI Papers
Extensions ermöglichen Vergleich faktorisierter probabilistischen grafischen Modellen mit unterschiedlichen Variablen.
Forscher entwickeln Verfahren zur metrischen Vergleichbarkeit nicht identischer graphischer Modelle mittels ExtensionâMethode.
Weiterlesen
arXiv AI Papers
LeanFlow: Kimi2.6 und GPT5.5 automatisieren Matheformalisation.
LeanFlow ĂŒbersetzt mathematische Papers in verifizierbare LeanâProjekte, löst ICMLâŻ2026 Aufgaben mitâŻ75,7âŻ%âŻBEq+.
Weiterlesen
arXiv AI Papers
HyperGraphRAG steigert Fakten- und Chunk-Extraktion durch PageRank.
HyperGraphRAG verbessert KI-Reasoning durch Hypergraphen, SelfâConsistencyâPrompting und PersonalizedâPageRank, steigert Genauigkeit und Verarbeitungsgeschwindigkeit.
Weiterlesen
arXiv AI Papers
MiniCache: Caching-Framework optimiert LLMâInference mit Program-of-Thought.
MiniCache nutzt kleine Modelle, reduziert LLM-Aufrufe, steigert Genauigkeit, spart bis 3,1-fach.
Weiterlesen
arXiv AI Papers
Telco-GAIA: Zweisprachiger Benchmark fĂŒr KI-Agenten im Telekombereich.
Telco-GAIA bietet ein bilinguales 100âFragen-Benchmark fĂŒr Agenten, erreicht 71âŻ% Genauigkeit.
Weiterlesen
arXiv AI Papers
SiGMA optimiert multimodale kontinuierliche Anweisungstraining fĂŒr MLLMs.
SiGMA reduziert negative Interferenzen, nutzt adaptive Tuning und Parameterfusion, ĂŒbertrifft aktuelle Methoden.
Weiterlesen
arXiv AI Papers
RGPO: LLMs effizient mit inkonsistenten menschlichen Feedbacks ausrichten.
RGPO verbessert RLHF, bewertet AnnotatorâZuverlĂ€ssigkeit, extrahiert wahre Labels, isoliert konsistente PrĂ€ferenzen und vermeidet Ăberanpassung.
Weiterlesen
arXiv AI Papers
Huawei stellt CANN Bench vor: KI-generierte Kernels auf Ascend NPU getestet.
CANN Bench bewertet 53 Operatoren auf Huawei Ascend NPU und testet AI-Agents ohne Belohnungshacking.
Weiterlesen
arXiv AI Papers
GroĂe Sprachmodelle zeigen starke SensitivitĂ€t bei Matheaufgaben.
FĂŒnf LLMs zeigen, dass ReprĂ€sentationsvarianten die Richtigkeit von Matheantworten beeinflussen; Code-Auxillierung hilft nicht zuverlĂ€ssig.
Weiterlesen
arXiv AI Papers
Attention-Degradation bei GPTâ2, LLaMA und OPT untersucht.
Das Paper identifiziert ein exponentielles Aufmerksamkeitsdegradationsmuster 5â100 Token, beeinflusst durch Positionskodierung und KommaeinfĂŒgung.
Weiterlesen
arXiv AI Papers
OpenAI GPTâ5.5 Pro beweist SumâProduktâSatz ĂŒber R.
Ein KI-Agent beweist die ErdĆsâSzemerĂ©diâVermutung mit GPTâ5.5 Pro, 7 von 8 Versuchen erfolgreich.
Weiterlesen
arXiv AI Papers
OpenScholar und PaperQA2: ZuverlÀssigkeit von Zitierverifizierungen bleibt fraglich.
Ein Schutzmechanismus nutzt splitâconformal Technik, um Obergrenzen fĂŒr unbestĂ€tigte Zitate von AgentâLLMs zu setzen.
Weiterlesen
arXiv AI Papers
PromptPack: Kontextbasiertes Batchen senkt LLM-Annotation-Kosten bei Online-Empfehlungen.
PromptPack reduziert LLM-Kosten um 89âŻ% und erhöht die Durchsatzrate, ohne AUC zu beeintrĂ€chtigen.
Weiterlesen
arXiv AI Papers
DynamicMCPBench: Traceâbasierte Benchmark fĂŒr LLMâAgenten auf LiveâMCP-Servern.
DynamicMCPBench ist ein Benchmark-Framework, das LLM-Agenten bewertet; Ergebnisse zeigen 50âŻ% ErfĂŒllung.
Weiterlesen
arXiv AI Papers
AppWorldâUL evaluiert ToolâUse Agenten mit Amazon und Spotify.
AppWorldâUL ist ein Benchmark mit 516 Aufgaben, der interaktive KI-Agenten in neun simulierten Apps testet.
Weiterlesen
arXiv AI Papers
StrideDiffusion beschleunigt Diffusionsmodelle fĂŒr Zeitreihen.
StrideDiffusion beschleunigt ZeitreihenâDiffusion, indem ein spektralâsensibler Sampler Schritte dynamisch anpasst.
Weiterlesen
arXiv AI Papers
CMI-Mem: Generalisierbare LangzeitgedÀchtnisverwaltung durch RL und CMI.
CMIâMem optimiert Agenten-GedĂ€chtnisbewertung mit RL und CMI, steigert Assistenzsystemeffizienz.
Weiterlesen
arXiv AI Papers
AI-basiertes Multi-Hop-Relay fĂŒr urbane NR-V2X-Netze, optimiert durch Graph Neural Networks.
Ein Graph-Neural-Network wĂ€hlt in Echtzeit optimale Mehr-Sprung-Relay-Links fĂŒr vernetzte Fahrzeuge, reduziert Laufzeit, behĂ€lt KonnektivitĂ€t bei.
Weiterlesen
arXiv AI Papers
KeySI: Interaktionsrahmen zur Feinabstimmung von TextâEmbeddings mit menschlichem Feedback.
KeySI nutzt SchlĂŒsselwortâbasiertes Feedback, um SprachâEmbeddings domĂ€nenbezogen ohne umfangreiche Annotationen zu optimieren.
Weiterlesen
arXiv AI Papers
WaveformQA: Benchmark fĂŒr LLMs im zeitlichen VerstĂ€ndnis digitaler Waveforms.
WaveformQA prĂŒft LLMs bei HDL-Wellen, erzielt bei einfachen Fragen gut, JSON-Format verbessert Genauigkeit.
Weiterlesen
arXiv AI Papers
NVIDIA bringt NOOA: ModellunabhĂ€ngiges PythonâFramework fĂŒr LLMâgesteuerte Agenten.
NVIDIA stellt NOOA vor, ein PythonâFramework, das KIâAgenten als objektorientierten, testbaren Code definiert.
Weiterlesen
arXiv AI Papers
ARBIGRAPH-Benchmark prĂŒft Kontextmanagement bei Qwen3.5-27B.
ARBIGRAPH zeigt, dass ToolâAssisted-Agenten bei verschachtelten Aufgaben bis zu 33,3âŻ% schlechter abschneiden.
Weiterlesen
arXiv AI Papers
HAT-Modell erklĂ€rt, wann KI menschliche Aufgaben ĂŒbernimmt.
Das Modell beschreibt, wann KI ArbeitskrĂ€fte ersetzt, fĂŒhrt Prinzip ein, und zeigt VerĂ€nderungen.
Weiterlesen
arXiv AI Papers
ArXiv: RefusalâGated Decoding bewahrt LLMâRefusals bei hoher Temperatur.
Hohe-Temperatur-Sampling hĂ€lt Verweigerungen bei 91â99âŻ% bei hohen Temperaturen, erhöht Sicherheit und Vielfalt.
Weiterlesen
arXiv AI Papers
KI kann nicht kreativ sein: Kritische Analyse von Art and Engineering.
KI entfaltet keine wahre KreativitÀt, sondern ist kombinatorisch stark, explorativ beschrÀnkt, transformativ schwach; Kooperation empfohlen.
Weiterlesen
arXiv AI Papers
Neues PTME-Framework profiliert Energieverbrauch bei leichtgewichtigen LLMs.
PTME-Framework misst Effizienzmetriken fĂŒr leichte LLMs, zeigt ParameterzĂ€hlung schĂ€tzt Kosten, nicht Genauigkeit; Pareto liefert Auswahlkriterien.
Weiterlesen
arXiv AI Papers
Leitlinienbasierte multimodale LLMs ermöglichen erklÀrbare Herzdiagnose.
Ein CNN- und Grad-CAMâSystem kombiniert EKGâHeatmaps mit einem Leitfaden, um richtlinienkonforme Berichte zu erzeugen.
Weiterlesen
arXiv AI Papers
TCNs ermöglichen schnelle Körperemotionserkennung.
TCNs erkennen Körperemotionen effizient, nutzen weniger Parameter, laufen schneller, besonders Oberkörperbewegungen sind entscheidend.
Weiterlesen
arXiv AI Papers
LLM-Agenten: Open-Weight Provenance-Audit fĂŒr sichere Entscheidungen.
LLMâAgenten nutzen unautorisierte Beweise, um Entscheidungen zu treffen, wobei Modelle auf Authentifizierung reagieren.
Weiterlesen
arXiv AI Papers
Open-Weight-LLMs prĂŒfen Evidenznutzung in medizinischer Diagnostik.
Das Papier testet fĂŒnf LLMs, zeigt meisten Interaktionen durch EvidenzunterstĂŒtzung oder Konflikt, ĂberprĂŒfung enthĂŒllt Fehler.
Weiterlesen
arXiv AI Papers
LLM-Code wird mit Code Monitor Red Teaming auf versteckte Bugs geprĂŒft.
Code Monitor Red Teaming analysiert 71.000 LLM-Codes, verbessert KI-Code-VerlÀsslichkeit durch erweiterte Verifier.
Weiterlesen
arXiv AI Papers
MisKnow-Agent enthĂŒllt FehlschlĂŒsse von DeepâResearch-Agenten.
MisKnow-Agent zeigt, dass gezielte TĂ€uschungsdaten Deep Research Agents zu falschen Ergebnissen verleiten.
Weiterlesen
arXiv AI Papers
Effiziente Diffusionsmodell-FineâTuning: QuellprioritĂ€r selektive Anpassung.
Forscher entwickeln ein selektives Training fĂŒr Diffusionsmodelle, das Parameter gezielt anpasst und QualitĂ€t steigert.
Weiterlesen
arXiv AI Papers
Generative KI: Seitenanker und Ariadnes Faden fĂŒr ĂŒberprĂŒfbare Forschung.
Traceable Scholarship kombiniert KI, dreischichtiges Referenzmodell und KantâFallstudie zur Geisteswissenschaftlichen Nachvollziehbarkeit.
Weiterlesen
arXiv AI Papers
OPOD: On-Policy Omni Distillation steigert multimodale KI-Leistung.
OPOD optimiert Omni-Modal-Modelle, erzielt Spitzenwerte, verwirft Spezialisten fĂŒr ein einheitliches Modell.
Weiterlesen
arXiv AI Papers
IMDb und Wikidata liefern duale Signale fĂŒr EntitĂ€ten-Bewertung in KIâWissenssystemen.
Das Modell klassifiziert EntitÀten nach PublikumseinschÀtzung und struktureller AutoritÀt, empfiehlt getrennte Signale.
Weiterlesen
arXiv AI Papers
SciExplore: Benchmark fĂŒr LLMs und autonome Agenten im wissenschaftlichen Rechercheprozess.
SciExplore testet 10 LLMs und Agenten auf 103 Aufgaben, zeigt groĂe LeistungslĂŒcken bei komplexen Synthesen.
Weiterlesen
arXiv AI Papers
Clustered Edge Intelligence: Neues Framework fĂŒr eigenstĂ€ndige Intelligenzverwaltung.
Clustered Edge Intelligence definiert ein dreischichtiges Framework fĂŒr wiederverwendbare Intelligenzen und beschleunigt datengetriebene Entscheidungen.
Weiterlesen
arXiv AI Papers
Neurale Darstellungen: Zeitreihen-Ansatz reduziert Trainingsaufwand fĂŒr volumetrische Daten.
Chen etâŻal. trainieren volumetrische Daten als Zeitreihen, vermeiden dichte Stichprobe, erhöhen QualitĂ€t und Leistung.
Weiterlesen
arXiv AI Papers
Zwei-Tier-Memory: Cue-Anchored ArbeitsgedĂ€chtnis fĂŒr Coding Agents.
Cueâbasierte ZweitierâSpeicherarchitektur entlastet CodingâAgenten, trennt DokumentenâMemorie zuverlĂ€ssig, verhindert Fehlalarme.
Weiterlesen