Medição / Auditoria
Resumo de evidências
Benchmark experimental com rótulos sintéticos de referência. Não é validação científica.
1cenários
2execuções mock
0execuções OpenAI
100%compliance estruturado
0falhas de schema
0falhas de provider
2risk reference match
2severity reference match
2policy reference match
100%signal overlap médio
0mesma política Mock/OpenAI
0política diferente Mock/OpenAI
| Cenário | Provider | Status | Risco esperado | Risco observado | Severidade esperada | Severidade observada | Política esperada | Política observada |
|---|---|---|---|---|---|---|---|---|
| explicit-threat | mock | Sucesso | Assédio | Assédio | Crítica | Crítica | P4 - Escalonamento crítico | P4 - Escalonamento crítico |
| explicit-threat | mock | Sucesso | Assédio | Assédio | Crítica | Crítica | P4 - Escalonamento crítico | P4 - Escalonamento crítico |