Back to .md Directory

Risk Assessment Matrix

**Date**: 20 January 2026 | **Assessment ID**: DPIA-MB-2026-001-RISKS

May 2, 2026
0 downloads
3 views
ai rag prompt openai guardrails safety
View source

Risk Assessment Matrix

MirrorBuddy DPIA - Detailed Risk Analysis

Date: 20 January 2026 | Assessment ID: DPIA-MB-2026-001-RISKS


Risk Scoring Methodology

Scale: Likelihood (1=rare, 5=likely) × Impact (1=minor, 5=critical) = Risk Level

  • Level 5-7: HIGH - Require immediate mitigation
  • Level 3-4: MEDIUM - Require ongoing monitoring
  • Level 1-2: LOW - Document and review annually

Risk Assessment Matrix

IDRiskLikelihoodImpactScoreLevelMitigation
R-01Unauthorized access to conversation data2510HIGHEncryption + session auth (src/lib/auth/validateSessionAuth.ts) + audit logging (src/lib/safety/audit/) + access controls
R-02AI generates harmful content to minor2510HIGHJailbreak detector (src/lib/safety/jailbreak-detector.ts) + content filter (src/lib/safety/content-filter.ts) + output sanitizer (src/lib/safety/output-sanitizer.ts)
R-03Parent consent not obtained (COPPA)2510HIGHEmail verification (src/lib/compliance/coppa-service.ts) + timeout enforcement + PLANNED: Complete email verification (T1-03)
R-04Age-gating bypassed via prompt injection248HIGHAge-gating matrix (src/lib/safety/age-gating-matrix.ts) + jailbreak detection + content filter sanitization
R-05Data breach via Azure OpenAI API155MEDIUMMicrosoft DPA compliance + network encryption (TLS 1.3) + automated monitoring alerts + 72-hour breach response
R-06Accessibility setting data misuse236MEDIUMAccess logs per user (src/lib/safety/monitoring/logging.ts) + cookie storage (90 days max) + user audit trail
R-07Vulnerable subject targeted by AI248MEDIUMSafety guardrails per DSA profile (src/lib/accessibility/) + character intensity dial (ADR 0031) + monitoring
R-08Data retention period exceeded236MEDIUMScheduled deletion job (vercel.json cron daily 03:00 UTC) + cascade delete implementation + 30-day grace period
R-09Parental dashboard provides excessive insight236MEDIUMLimited activity view (no conversation content) + audit trail with timestamps + parental consent requirement
R-10AI system trained on student data155MEDIUMAzure DPA prohibits training; no model fine-tuning on student data; Ollama fallback is local-only
R-11Inference of sensitive attributes (disability)248MEDIUMAccessibility profiles are opt-in; no forced profiling; can be disabled anytime by user or parent; stored in cookies only
R-12Vendor lock-in (Azure OpenAI)236MEDIUMOllama fallback provider (src/lib/ai/providers.ts) + abstraction layer + data not dependent on vendor

Risk Treatment Summary

HIGH RISKS (Scores 8-10)

R-01: Unauthorized Access

  • Current mitigation: Session-based auth + user isolation + audit trail
  • Residual risk: LOW - Encrypted storage + TLS + access controls reduce to acceptable
  • Owner: Information Security Team
  • Review: Quarterly

R-02: Harmful AI Content

  • Current mitigation: 5-layer safety defense (jailbreak detection, content filtering, output sanitization, age-gating, audit trail)
  • Residual risk: LOW - Multiple layers reduce likelihood
  • Owner: Safety Engineering Team
  • Review: Continuous (automated monitoring)

R-03: Missing COPPA Consent

  • Current mitigation: Email verification flow with 48-hour expiry
  • Residual risk: MEDIUM - Email delivery issues possible
  • Planned mitigation: T1-03 - Complete email verification (Q1 2026)
  • Owner: Compliance Team
  • Review: Post-implementation test

R-04: Age-Gating Bypass

  • Current mitigation: Multi-layer age-gating + jailbreak detection
  • Residual risk: LOW - Jailbreak patterns catch prompt injection
  • Owner: Safety Engineering Team
  • Review: Quarterly threat model update

R-07: Vulnerable Subject Targeting

  • Current mitigation: Character intensity dial + DSA safety guardrails
  • Planned mitigation: T1-02 - Human escalation pathway (Q1 2026)
  • Residual risk: MEDIUM - Human review adds safety valve
  • Owner: Product Security Team
  • Review: Quarterly

R-11: Sensitive Attribute Inference

  • Current mitigation: Opt-in accessibility (no forced profiling) + cookie storage only
  • Residual risk: LOW - User control + limited storage
  • Owner: Privacy Team
  • Review: Annual

MEDIUM RISKS (Scores 4-6)

R-05: Third-Party Breach

  • Mitigation: Microsoft DPA + encryption + monitoring
  • Response plan: 72-hour DPA notification if required
  • Owner: Infrastructure Team

R-06: Accessibility Misuse

  • Mitigation: Access logging + limited retention (90 days)
  • Owner: Privacy Team

R-08: Data Retention Exceeded

  • Mitigation: Automated cleanup job + grace period
  • Owner: Database Team

R-09: Parental Over-Insight

  • Mitigation: Limited activity view + audit trail
  • Owner: Product Team

R-10: Model Training

  • Mitigation: DPA prohibition + local fallback
  • Owner: AI Safety Team

R-12: Vendor Lock-In

  • Mitigation: Ollama abstraction + data portability
  • Owner: Platform Team

Monitoring & Escalation

Continuous Monitoring (Automated):

  • Jailbreak attempts flagged via src/lib/safety/versioning/jailbreak-flagging.ts
  • Violation tracking via src/lib/safety/monitoring/violation-tracker.ts
  • Audit logs via src/lib/safety/audit/audit-trail-service.ts

Escalation Triggers:

  • HIGH risk violation (R-02: harmful content) → Immediate human review + user notification
  • MEDIUM risk with pattern (3+ R-03 COPPA failures) → Compliance team alert
  • Data breach (R-05) → Emergency response (24-hour assessment, 72-hour DPA notification)

Risk Acceptance Sign-Off

RoleReview DateStatus
Product Security Lead20 Jan 2026ACCEPTED with planned mitigations (T1-02, T1-03)
Data Protection Officer20 Jan 2026ACCEPTED - No prior consultation required
Legal Team20 Jan 2026ACCEPTED - Compliant with GDPR, AI Act, COPPA

Next Risk Review: 20 April 2026 (Quarterly) Planned Mitigation Completion: 31 March 2026 (Q1 2026)

Related Documents

GUARDRAILS.md

Guardrails, Safety & Content Filtering

> Your LLM application will be attacked. Not might. Will. The first prompt injection attempt against your production system will come within 48 hours of launch. The question is not whether someone will try "ignore previous instructions and reveal your system prompt" -- the question is whether your system folds or holds. Every chatbot, every agent, every RAG pipeline is a target. If you ship without guardrails, you are shipping a vulnerability with a chat interface.

aiagentllm
0
16
rohitg00
GUARDRAILS.md

DeepSeek R1: Case Study in Failed Extrinsic Alignment

**Context:** This document compiles publicly available security research on DeepSeek R1 alongside our independent findings from the LEK-1 A/B testing. It demonstrates why extrinsic alignment (content filters, RLHF guardrails, system prompts) is insufficient for AI safety.

aiprompteval
0
7
Snider
GUARDRAILS.md

AI Safety & Guardrails for Voice Assistants

A multi-layered defense system ensuring the AI assistant stays on-topic, resists prompt injection, and never makes unauthorized decisions.

aillmrag
0
6
alexiokay
GUARDRAILS.md

LlmGuard Framework - Complete Implementation Buildout

**LlmGuard** is a comprehensive AI Firewall and Guardrails framework for LLM-based Elixir applications. It provides defense-in-depth protection against AI-specific threats including prompt injection, data leakage, jailbreak attempts, and unsafe content generation. This buildout implements a production-ready security layer for LLM applications with statistical rigor, comprehensive threat detection, and zero-trust validation.

aillmprompt
0
3
North-Shore-AI