ShieldGemma
Unknown
ShieldGemma is a suite of LLM-based safety content moderation models built on Gemma2 that predict safety risks across key harm types in user input and LLM-generated output.
A comprehensive index of artificial intelligence and machine-learning research with AI-generated summaries, citation metrics, and direct links to papers and code.
Unknown
ShieldGemma is a suite of LLM-based safety content moderation models built on Gemma2 that predict safety risks across key harm types in user input and LLM-generated output.
Unknown
SweEval is a cross-lingual safety benchmark that evaluates LLMs on handling swear words across 8 languages, revealing higher vulnerability in Indic languages and transliterated contexts.
Unknown
Introduces Gemma, a family of 2B and 7B state-of-the-art language models derived from Google's Gemini, with advances in language understanding, reasoning, and safety.
Linjun Li
LLMs can appear safer under direct dangerous objectives than when mediated by other agents, revealing a compositional safety gap.
Junde Wu, Jiayuan Zhu, Yunli Qi
MedGraphRAG introduces a graph-based RAG framework to improve safety and accuracy of medical LLMs by structuring medical knowledge as a graph.
Unknown
This book provides a comprehensive introduction to foundation models, covering their core concepts, advanced topics, and safety considerations.
Unknown
OS-HARM is a benchmark for measuring the safety of LLM-based computer use agents.
Xu Li, Simon Yu, Minzhou Pan, et al.
Introduces MTAgentRisk, the first multi-turn safety benchmark for tool-using agents, revealing a 16% average increase in attack success rate across multiple turns.