Physical Sciences › Computer Science › Artificial Intelligence
Adversarial Robustness in Machine Learning
3.183 indexierte Paper
Dieses Unterthema und seine Hierarchie stammen aus der OpenAlex-Klassifikation, dem offenen Katalog der weltweiten wissenschaftlichen Forschung.
Monatliches Volumen — letzte 12 Monate
Neueste Paper
- PatchGuard: Adversarially Robust Anomaly Detection and Localization through Vision Transformers and Pseudo Anomalies
Mojtaba Nafez, Amirhossein Koochakian, Arad Maleki, Jafar Habibi, Mohammad Hossein Rohban · 27. Oktober 2025
- Register and [CLS] tokens yield a decoupling of local and global features in large ViTs
Alexander Lappe, Martin A. Giese · 27. Oktober 2025
- How Learning Dynamics Drive Adversarially Robust Generalization?
Yuelin Xu, Xiao Zhang · 27. Oktober 2025
- Enforcing Calibration in Multi-Output Probabilistic Regression with Pre-rank Regularization
Naomi Desobry, Elnura Zhalieva, Souhaib Ben Taieb · 27. Oktober 2025
- Can Current Detectors Catch Face-to-Voice Deepfake Attacks?
Nguyen Linh Bao Nguyen, Alsharif Abuadbba, Kristen Moore, Tingming Wu · 27. Oktober 2025
- On Uncertainty Calibration for Equivariant Functions
Edward Berman, Jacob Ginesin, Marco Pacini, Robin Walters · 27. Oktober 2025
- Probe-based Fine-tuning for Reducing Toxicity
Jan Wehner, Mario Fritz · 27. Oktober 2025
- Leverage Unlearning to Sanitize LLMs
Antoine Boutet, Lucas Magnana · 27. Oktober 2025
- Dynamic Target Attack
Kedong Xiu, Churui Zeng, Tianhang Zheng, Xinzhe Huang, Xiaojun Jia, Di Wang, Puning Zhao, Zhan Qin, Kui Ren · 27. Oktober 2025
- Distillation Robustifies Unlearning
Bruce W. Lee, Addie Foote, Alex Infanger, Leni Shor, Harish Kamath, Jacob Goldman-Wetzler, Bryce Woodworth, Alex Cloud, Alexander Matt Turner · 27. Oktober 2025
- How Toxic Can You Get? Search-based Toxicity Testing for Large Language Models
Simone Corbo, Luca Bancale, Valeria De Gennaro, Livia Lestingi, Vincenzo Scotti, Matteo Camilli · 27. Oktober 2025
- DynamicPAE: Generating Scene-Aware Physical Adversarial Examples in Real-Time
Jin Hu, Xianglong Liu, Jiakai Wang, Junkai Zhang, Xianqi Yang, Haotong Qin, Yuqing Ma, Ke Xu · 27. Oktober 2025
- Alert-ME: An Explainability-Driven Defense Against Adversarial Examples in Transformer-Based Text Classification
Bushra Sabir (CSIRO's Data61), Yansong Gao (The University of Western Australia), Alsharif Abuadbba (CSIRO's Data61), M. Ali Babar (The University of Adelaide, CREST- The Centre for Research on Engineering Software Technologies) · 27. Oktober 2025
- DEEDEE: Fast and Scalable Out-of-Distribution Dynamics Detection
Tala Aljaafari, Varun Kanade, Philip Torr, Christian Schroeder de Witt · 27. Oktober 2025
- Quantifying CBRN Risk in Frontier Models
Divyanshu Kumar, Nitin Aravind Birur, Tanay Baswa, Sahil Agarwal, Prashanth Harshangi · 27. Oktober 2025
- An Experimental Study of Trojan Vulnerabilities in UAV Autonomous Landing
Reza Ahmari, Ahmad Mohammadi, Vahid Hemmati, Mohammed Mynuddin, Mahmoud Nabil Mahmoud, Parham Kebria, Abdollah Homaifar, Mehrdad Saif · 27. Oktober 2025
- Learning Neural Control Barrier Functions from Expert Demonstrations using Inverse Constraint Learning
Yuxuan Yang, Hussein Sibai · 27. Oktober 2025
- Information Retrieval Induced Safety Degradation in AI Agents
Cheng Yu, Benedikt Stroebl, Diyi Yang, Orestis Papakyriakopoulos · 27. Oktober 2025
Cette recherche explore comment donner aux IA plus d'accès à des informations externes influence leur sécurité et leur comportement éthique. En testant différents niveaux d'accès à Internet, les chercheurs ont constaté qu'une intégration plus large augmente les risques de biais, de production de contenus nuisibles et de comportements dangereux. Même avec des mesures pour limiter ces impacts, ces risques persistent et peuvent s'aggraver. Ces résultats soulignent l'importance de développer des stratégies pour garantir que les IA restent fiables et éthiques lorsqu'elles utilisent des sources d'informations externes.
