Security code review
Find security vulnerabilities in real application code and fix them without breaking legitimate behavior
Ranking groups use separate scales. Compare configurations only inside the same group; EvalRank never flattens unlike systems into one leaderboard.
Cross-benchmark consensus
One merged ranking of models by where they place across this topic's benchmark boards. Derived from the boards below, not a calibrated top set; it updates as sources are re-scraped.
| Rank | Model | Score | Benchmarks |
|---|---|---|---|
| 1 | gpt-6 astra (max) deepsecbench-aa:2f339a97.9a0d-499a-9cb5-e0db665bfa25 | 0.889 | 1 |
| 2 | kimi k3 (max) deepsecbench-aa-refusal:f7d2fc3e-1f7b-405f-818c-07952a4af78f | 0.889 | 1 |
| 3 | grok 4.7 (xhigh) cwe-bench-aa:59627802.1546.422c-9a65.65b61c022d36 | 0.882 | 1 |
| 4 | mimo-v2.6-pro cybergym-e2e-aa:24d8fdfe-6241.424e-b7b7.1b6efb06e4fb | 0.882 | 1 |
| 5 | deepseek v4.1 flash (max) deepsecbench-aa:dbe7c625.3100.4463-b479-a228c41f75dd | 0.789 | 1 |
| 6 | gemini 3.8 flash (high) deepsecbench-aa-refusal:8a999846.4c1d-4ce7-a8b7.1310a7166fd7 | 0.789 | 1 |
| 7 | deepseek v4.1 flash (max) cwe-bench-aa:dbe7c625.3100.4463-b479-a228c41f75dd | 0.778 | 1 |
| 8 | gpt-6 luna (max) cybergym-e2e-aa:6fb13851.40ce-4bda-ad3f-6b38e0c5daa7 | 0.778 | 1 |
| 9 | gpt-6 luna (max) deepsecbench-aa-refusal:6fb13851.40ce-4bda-ad3f-6b38e0c5daa7 | 0.700 | 1 |
| 10 | grok 4.7 (xhigh) deepsecbench-aa:59627802.1546.422c-9a65.65b61c022d36 | 0.700 | 1 |
| 11 | glm 5.3 flash cybergym-e2e-aa:19496b81.9f41.4214-a77a-1df803b3c5ae | 0.684 | 1 |
| 12 | gpt-6 astra (max) cwe-bench-aa:2f339a97.9a0d-499a-9cb5-e0db665bfa25 | 0.684 | 1 |
| 13 | claude fable 5.1 (max, default fallback) deepsecbench-aa-refusal:3e87c73e-a257.495e-9730.367a66229811 | 0.619 | 1 |
| 14 | claude opus 5.5 (max, default fallback) deepsecbench-aa:2f3c4dc9-a450.4303.8697.0237257cf08f | 0.619 | 1 |
| 15 | grok 4.7 (xhigh) cybergym-e2e-aa:59627802.1546.422c-9a65.65b61c022d36 | 0.600 | 1 |
| 16 | mimo-v2.6-pro cwe-bench-aa:24d8fdfe-6241.424e-b7b7.1b6efb06e4fb | 0.600 | 1 |
| 17 | glm-5.3 (max) deepsecbench-aa-refusal:cd684ea4-b475.4269-b001-d469d06d8a7a | 0.545 | 1 |
| 18 | mimo-v2.6-pro deepsecbench-aa:24d8fdfe-6241.424e-b7b7.1b6efb06e4fb | 0.545 | 1 |
| 19 | muse spark 1.3 (xhigh) cwe-bench-aa:d5170215.69be-4129.849b-26d8d8825bfc | 0.524 | 1 |
| 20 | muse spark 1.3 (xhigh) cybergym-e2e-aa:d5170215.69be-4129.849b-26d8d8825bfc | 0.524 | 1 |
| 21 | gpt-5.6 terra (max) deepsecbench-aa:bcf8db0a-3bb6.4d82.9516.0f57370c85a6 | 0.478 | 1 |
| 22 | gpt-6 astra (max) deepsecbench-aa-refusal:2f339a97.9a0d-499a-9cb5-e0db665bfa25 | 0.478 | 1 |
| 23 | claude opus 5.5 (max, default fallback) cwe-bench-aa:2f3c4dc9-a450.4303.8697.0237257cf08f | 0.455 | 1 |
| 24 | kimi k3 (max) cybergym-e2e-aa:f7d2fc3e-1f7b-405f-818c-07952a4af78f | 0.455 | 1 |
| 25 | glm-5.3 (max) deepsecbench-aa:cd684ea4-b475.4269-b001-d469d06d8a7a | 0.417 | 1 |
| 26 | muse spark 1.3 (xhigh) deepsecbench-aa-refusal:d5170215.69be-4129.849b-26d8d8825bfc | 0.417 | 1 |
| 27 | glm-5.3 (max) cybergym-e2e-aa:cd684ea4-b475.4269-b001-d469d06d8a7a | 0.391 | 1 |
| 28 | gpt-6 luna (max) cwe-bench-aa:6fb13851.40ce-4bda-ad3f-6b38e0c5daa7 | 0.391 | 1 |
| 29 | deepseek v4.1 flash (max) deepsecbench-aa-refusal:dbe7c625.3100.4463-b479-a228c41f75dd | 0.360 | 1 |
| 30 | gpt-6 luna (max) deepsecbench-aa:6fb13851.40ce-4bda-ad3f-6b38e0c5daa7 | 0.360 | 1 |
| 31 | glm-5.3 (max) cwe-bench-aa:cd684ea4-b475.4269-b001-d469d06d8a7a | 0.333 | 1 |
| 32 | minimax-m3 cybergym-e2e-aa:277f939a-985b-4b37.859d-b3eabc7c0b26 | 0.333 | 1 |
| 33 | claude fable 5.1 (max, default fallback) deepsecbench-aa:3e87c73e-a257.495e-9730.367a66229811 | 0.308 | 1 |
| 34 | grok 4.7 (xhigh) deepsecbench-aa-refusal:59627802.1546.422c-9a65.65b61c022d36 | 0.308 | 1 |
| 35 | deepseek v4.1 flash (max) cybergym-e2e-aa:dbe7c625.3100.4463-b479-a228c41f75dd | 0.280 | 1 |
| 36 | glm 5.3 flash cwe-bench-aa:19496b81.9f41.4214-a77a-1df803b3c5ae | 0.280 | 1 |
| 37 | glm 5.3 flash deepsecbench-aa:19496b81.9f41.4214-a77a-1df803b3c5ae | 0.259 | 1 |
| 38 | minimax-m3 deepsecbench-aa-refusal:277f939a-985b-4b37.859d-b3eabc7c0b26 | 0.259 | 1 |
| 39 | kimi k3 (max) cwe-bench-aa:f7d2fc3e-1f7b-405f-818c-07952a4af78f | 0.231 | 1 |
| 40 | nemotron 3 ultra 550b a55b (reasoning) cybergym-e2e-aa:5b52def2-ac9b-4465-ad80.91ea8079e253 | 0.231 | 1 |
| 41 | gemini 3.8 flash (high) deepsecbench-aa:8a999846.4c1d-4ce7-a8b7.1310a7166fd7 | 0.214 | 1 |
| 42 | glm 5.3 flash deepsecbench-aa-refusal:19496b81.9f41.4214-a77a-1df803b3c5ae | 0.214 | 1 |
| 43 | gemini 3.8 flash (high) cwe-bench-aa:8a999846.4c1d-4ce7-a8b7.1310a7166fd7 | 0.185 | 1 |
| 44 | gemini 3.8 flash (high) cybergym-e2e-aa:8a999846.4c1d-4ce7-a8b7.1310a7166fd7 | 0.185 | 1 |
| 45 | claude opus 5.5 (max, default fallback) deepsecbench-aa-refusal:2f3c4dc9-a450.4303.8697.0237257cf08f | 0.172 | 1 |
| 46 | muse spark 1.3 (xhigh) deepsecbench-aa:d5170215.69be-4129.849b-26d8d8825bfc | 0.172 | 1 |
| 47 | claude fable 5.1 (max, default fallback) cwe-bench-aa:3e87c73e-a257.495e-9730.367a66229811 | 0.143 | 1 |
| 48 | claude fable 5.1 (max, default fallback) cybergym-e2e-aa:3e87c73e-a257.495e-9730.367a66229811 | 0.143 | 1 |
| 49 | kimi k3 (max) deepsecbench-aa:f7d2fc3e-1f7b-405f-818c-07952a4af78f | 0.133 | 1 |
| 50 | mimo-v2.6-pro deepsecbench-aa-refusal:24d8fdfe-6241.424e-b7b7.1b6efb06e4fb | 0.133 | 1 |
| 51 | claude opus 5.5 (max, default fallback) cybergym-e2e-aa:2f3c4dc9-a450.4303.8697.0237257cf08f | 0.103 | 1 |
| 52 | minimax-m3 cwe-bench-aa:277f939a-985b-4b37.859d-b3eabc7c0b26 | 0.103 | 1 |
| 53 | nemotron 3 ultra 550b a55b (reasoning) deepsecbench-aa-refusal:5b52def2-ac9b-4465-ad80.91ea8079e253 | 0.097 | 1 |
| 54 | qwen3.8 27b (xhigh) deepsecbench-aa:b01dee41-c62b-48ed-8d16.984adc405e5c | 0.097 | 1 |
| 55 | gpt-6 astra (max) cybergym-e2e-aa:2f339a97.9a0d-499a-9cb5-e0db665bfa25 | 0.067 | 1 |
| 56 | qwen3.8 2.4t a95b cwe-bench-aa:8df710d3.9dae-4498.9b4e-9818238e6f31 | 0.067 | 1 |
| 57 | qwen3.8 2.4t a95b deepsecbench-aa:8df710d3.9dae-4498.9b4e-9818238e6f31 | 0.063 | 1 |
| 58 | qwen3.8 27b (xhigh) deepsecbench-aa-refusal:b01dee41-c62b-48ed-8d16.984adc405e5c | 0.063 | 1 |
| 59 | nemotron 3 ultra 550b a55b (reasoning) cwe-bench-aa:5b52def2-ac9b-4465-ad80.91ea8079e253 | 0.032 | 1 |
| 60 | qwen3.8 2.4t a95b cybergym-e2e-aa:8df710d3.9dae-4498.9b4e-9818238e6f31 | 0.032 | 1 |
| 61 | gpt-5.6 terra (max) deepsecbench-aa-refusal:bcf8db0a-3bb6.4d82.9516.0f57370c85a6 | 0.030 | 1 |
| 62 | minimax-m3 deepsecbench-aa:277f939a-985b-4b37.859d-b3eabc7c0b26 | 0.030 | 1 |
| 63 | nemotron 3 ultra 550b a55b (reasoning) deepsecbench-aa:5b52def2-ac9b-4465-ad80.91ea8079e253 | 0.000 | 1 |
| 64 | qwen3.8 2.4t a95b deepsecbench-aa-refusal:8df710d3.9dae-4498.9b4e-9818238e6f31 | 0.000 | 1 |
| 65 | qwen3.8 27b (xhigh) cwe-bench-aa:b01dee41-c62b-48ed-8d16.984adc405e5c | 0.000 | 1 |
| 66 | qwen3.8 27b (xhigh) cybergym-e2e-aa:b01dee41-c62b-48ed-8d16.984adc405e5c | 0.000 | 1 |
Agent system ยท Agentic
Exploratory - not a ranked winner yetrg-security-code-review-agent-system-agentic-agent-system-v1Explorer evidence
CWE-Bench-AA (Artificial Analysis)
Sources differ; shown separately, never averaged. Observed ; fresh until .
| Rank | Configuration | Capability | Uncertainty | Families |
|---|---|---|---|---|
| 1 | Grok 4.7 (Xhigh) cwe-bench-aa:59627802-1546-422c-9a65-65b61c022d36config_31b6c76643164be43b610600471ddb316446ebf1e6a9ad852853f1e470fb4199 | 100% | Unknown | 1 |
| 2 | DeepSeek V4.1 Flash (Max) cwe-bench-aa:dbe7c625-3100-4463-b479-a228c41f75ddconfig_95fe43e740f5b9baa1d5680356b59f10473fbe2f8d056a79115e7d0c67feb93b | 100% | Unknown | 1 |
| 3 | GPT-6 Astra (Max) cwe-bench-aa:2f339a97-9a0d-499a-9cb5-e0db665bfa25config_0ff6c2e86d5fc3f8b315d1423793e587e2f52c6c7ae7e79ab9b3013eab9e95d2 | 88% | Unknown | 1 |
| 4 | MiMo-V2.6-Pro cwe-bench-aa:24d8fdfe-6241-424e-b7b7-1b6efb06e4fbconfig_78ea99edad6aab69cc66343588172e0229061ad766e52e4e070f86eeaa04fde9 | 88% | Unknown | 1 |
| 5 | Muse Spark 1.3 (Xhigh) cwe-bench-aa:d5170215-69be-4129-849b-26d8d8825bfcconfig_e2e4f79f907e348f11413c19f317fe67cb0b4a7134563eb463cc7363ccf6b36b | 82% | Unknown | 1 |
| 6 | Claude Opus 5.5 (Max, Default Fallback) cwe-bench-aa:2f3c4dc9-a450-4303-8697-0237257cf08fconfig_75aaaf8b916b7a66d01b00ce5506718dfaed135a097bd26331afc83e9ecf4ac1 | 76% | Unknown | 1 |
| 7 | GPT-6 Luna (Max) cwe-bench-aa:6fb13851-40ce-4bda-ad3f-6b38e0c5daa7config_93cace1581371fb001fba9498b62acaf028700c5d458e2ef6afcc240ee4dd573 | 72% | Unknown | 1 |
| 8 | GLM-5.3 (Max) cwe-bench-aa:cd684ea4-b475-4269-b001-d469d06d8a7aconfig_3325cc082d7df8068a9cc64cf63782c025776594aa02f9958e0fd96e482ceb18 | 70% | Unknown | 1 |
| 9 | GLM 5.3 Flash cwe-bench-aa:19496b81-9f41-4214-a77a-1df803b3c5aeconfig_dc33c85dfde445074d942c4ddea178f06044982b8d2822876c17e367ea5ef6bd | 70% | Unknown | 1 |
| 10 | Kimi K3 (Max) cwe-bench-aa:f7d2fc3e-1f7b-405f-818c-07952a4af78fconfig_831e7aa273ddac6f6370d6215175e8009fa1d7e307d5ad2f74218c5309fc2b91 | 64% | Unknown | 1 |
| 11 | Gemini 3.8 Flash (High) cwe-bench-aa:8a999846-4c1d-4ce7-a8b7-1310a7166fd7config_354b3e670d3aa257f24e6d3e5c7badd5feb44c68dee0982822a4e0922dfad597 | 62% | Unknown | 1 |
| 12 | Claude Fable 5.1 (Max, Default Fallback) cwe-bench-aa:3e87c73e-a257-495e-9730-367a66229811config_d8d4e1e7689af7c42f5688d542d5fb95f1a6b24903a29c9d49326ae537ee7b60 | 58% | Unknown | 1 |
| 13 | MiniMax-M3 cwe-bench-aa:277f939a-985b-4b37-859d-b3eabc7c0b26config_907105a30b99df99fd3e6f83c042c3dbe0ca75fcc5bc8f41d816424fb62b8ecc | 36% | Unknown | 1 |
| 14 | Qwen3.8 2.4T A95B cwe-bench-aa:8df710d3-9dae-4498-9b4e-9818238e6f31config_5088d33050ecbde1e905be1ccaca5d512398e5eb11772e6788e5090614251df8 | 4% | Unknown | 1 |
| 15 | Nemotron 3 Ultra 550B A55B (Reasoning) cwe-bench-aa:5b52def2-ac9b-4465-ad80-91ea8079e253config_7290235f7802366ba63fb8e54a91694fab50b54aa4f5f2c3972a4730210d3683 | 2% | Unknown | 1 |
| 16 | Qwen3.8 27B (Xhigh) cwe-bench-aa:b01dee41-c62b-48ed-8d16-984adc405e5cconfig_2e3dbb3ed500173be12ba8b8d88ab36215a87834ec2f22cca0882bb419c47abd | 0% | Unknown | 1 |
Source: Artificial Analysis
Explorer evidence
CyberGym-E2E-AA (Artificial Analysis)
Sources differ; shown separately, never averaged. Observed ; fresh until .
| Rank | Configuration | Capability | Uncertainty | Families |
|---|---|---|---|---|
| 1 | MiMo-V2.6-Pro cybergym-e2e-aa:24d8fdfe-6241-424e-b7b7-1b6efb06e4fbconfig_d2d43e8d5689df753e6392c341337b2e6dd4762d22e91dad49ea093d782eba56 | 100% | Unknown | 1 |
| 2 | GPT-6 Luna (Max) cybergym-e2e-aa:6fb13851-40ce-4bda-ad3f-6b38e0c5daa7config_33ac70fd3b281ee171b6c00d09b2ba45cef22c00bc0f392b52048434150a7684 | 99% | Unknown | 1 |
| 3 | GLM 5.3 Flash cybergym-e2e-aa:19496b81-9f41-4214-a77a-1df803b3c5aeconfig_391a2f97cd6d7edef6bf3d6afb02733a1e8ce0d920d170a4077434783b0e7788 | 94% | Unknown | 1 |
| 4 | Grok 4.7 (Xhigh) cybergym-e2e-aa:59627802-1546-422c-9a65-65b61c022d36config_aaf52d8b90c5731ebf5d37fa62c258a20f387ee2e22835179b6a4079821ebd5a | 94% | Unknown | 1 |
| 5 | Muse Spark 1.3 (Xhigh) cybergym-e2e-aa:d5170215-69be-4129-849b-26d8d8825bfcconfig_5d3fe8ba4305da3eeb8673a53458fe9daef0f16451269403dc9189794fdadd9b | 76% | Unknown | 1 |
| 6 | Kimi K3 (Max) cybergym-e2e-aa:f7d2fc3e-1f7b-405f-818c-07952a4af78fconfig_ded7b2f1e9adbbeb80f5b70cbecdc42cc37f2cb191b1d42d4d5815642935c021 | 74% | Unknown | 1 |
| 7 | GLM-5.3 (Max) cybergym-e2e-aa:cd684ea4-b475-4269-b001-d469d06d8a7aconfig_59bb674568f8034b73ea573ab86aa3f9e0a0974eddea4995d75181e368108a10 | 37% | Unknown | 1 |
| 8 | MiniMax-M3 cybergym-e2e-aa:277f939a-985b-4b37-859d-b3eabc7c0b26config_5d8cf94c70c5afe5499a6664d6343bae4c693746b626fc7f98daf2d4004a6ae1 | 31% | Unknown | 1 |
| 9 | DeepSeek V4.1 Flash (Max) cybergym-e2e-aa:dbe7c625-3100-4463-b479-a228c41f75ddconfig_89c2baf7b0f9c057baeb64a4bf0e891120f4b14f7295b405566f51b953c8b182 | 29% | Unknown | 1 |
| 10 | Nemotron 3 Ultra 550B A55B (Reasoning) cybergym-e2e-aa:5b52def2-ac9b-4465-ad80-91ea8079e253config_9f839de5800c532334b7301b3e2525ae7ef08ad1936d86c2755628a628d7497f | 14% | Unknown | 1 |
| 11 | Gemini 3.8 Flash (High) cybergym-e2e-aa:8a999846-4c1d-4ce7-a8b7-1310a7166fd7config_9da903d7339742b5ed052cab92fa9a59c1b4a2141673ce00df237005d4559eb6 | 11% | Unknown | 1 |
| 12 | Claude Fable 5.1 (Max, Default Fallback) cybergym-e2e-aa:3e87c73e-a257-495e-9730-367a66229811config_905f4d29a1510e42332187295d138b93d0f88844c7cf2fa6e8c69c0fb1a1ac24 | 1% | Unknown | 1 |
| 13 | Claude Opus 5.5 (Max, Default Fallback) cybergym-e2e-aa:2f3c4dc9-a450-4303-8697-0237257cf08fconfig_be9d5d4cfd8c60b5507cbcba14b62fde7659214df695b4d9a56d22a296fac86c | 1% | Unknown | 1 |
| 14 | GPT-6 Astra (Max) cybergym-e2e-aa:2f339a97-9a0d-499a-9cb5-e0db665bfa25config_1cd15a6088e4a68c6b73ebd0232967c15d229fa1ee90e5f603cf1d781d24c0f3 | 0% | Unknown | 1 |
| 15 | Qwen3.8 2.4T A95B cybergym-e2e-aa:8df710d3-9dae-4498-9b4e-9818238e6f31config_6b8c60882bfe0cc2b68ce67c24c8182a9dcdc88e285e3e66fd5a2b5782dc76f6 | 0% | Unknown | 1 |
| 16 | Qwen3.8 27B (Xhigh) cybergym-e2e-aa:b01dee41-c62b-48ed-8d16-984adc405e5cconfig_bc187f45ff6ce8d22223ae39007257df7b2a2670c4dcf933a103b3ad40c2558b | 0% | Unknown | 1 |
Source: Artificial Analysis
Explorer evidence
DeepsecBench-AA (Artificial Analysis)
Sources differ; shown separately, never averaged. Observed ; fresh until .
| Rank | Configuration | Capability | Uncertainty | Families |
|---|---|---|---|---|
| 1 | GPT-6 Astra (Max) deepsecbench-aa:2f339a97-9a0d-499a-9cb5-e0db665bfa25config_4d9b933720cbb942b3ce8e62a6339d2fc1a934cc2886c88c83ce213d2932b597 | 100% | Unknown | 1 |
| 2 | DeepSeek V4.1 Flash (Max) deepsecbench-aa:dbe7c625-3100-4463-b479-a228c41f75ddconfig_af6f67d7c876850b1891e6d16731dde0c7f41c61beafdf59e230b848373667c9 | 84% | Unknown | 1 |
| 3 | Grok 4.7 (Xhigh) deepsecbench-aa:59627802-1546-422c-9a65-65b61c022d36config_831bccb5b1f4d3c61244297d49ac1330bfd97bab0ddf73b410b12c70ac24cdca | 72% | Unknown | 1 |
| 4 | Claude Opus 5.5 (Max, Default Fallback) deepsecbench-aa:2f3c4dc9-a450-4303-8697-0237257cf08fconfig_93873bfa5f379c9cf84ddafd82635b56167f772bbcfcb317e684b8c87ea70f3d | 72% | Unknown | 1 |
| 5 | MiMo-V2.6-Pro deepsecbench-aa:24d8fdfe-6241-424e-b7b7-1b6efb06e4fbconfig_d4d043bf707aaab71397052547a416529a08d6e16b739c8ea24087e6bd654e35 | 70% | Unknown | 1 |
| 6 | GPT-5.6 Terra (Max) deepsecbench-aa:bcf8db0a-3bb6-4d82-9516-0f57370c85a6config_8ef6ec5b486b7ee6a334e39cdd06fd88d976d5e0445d225b54c0d20d003a9088 | 67% | Unknown | 1 |
| 7 | GLM-5.3 (Max) deepsecbench-aa:cd684ea4-b475-4269-b001-d469d06d8a7aconfig_0b2300dc53b9019c768961da18967120d4c054ec3c438c6fe19e9264f6aae2d3 | 65% | Unknown | 1 |
| 8 | GPT-6 Luna (Max) deepsecbench-aa:6fb13851-40ce-4bda-ad3f-6b38e0c5daa7config_40f58707d5621e7b3fd5a930856442c0b156820badbdea42a81d6c88a270a9a9 | 63% | Unknown | 1 |
| 9 | Claude Fable 5.1 (Max, Default Fallback) deepsecbench-aa:3e87c73e-a257-495e-9730-367a66229811config_adb39dd35b0fab85cac9cb9dec225f81ff4a0f47c2772e8d346802bbad63088f | 62% | Unknown | 1 |
| 10 | GLM 5.3 Flash deepsecbench-aa:19496b81-9f41-4214-a77a-1df803b3c5aeconfig_94cd6fd643d48ce80890973b339517db9badb898b1b87c03dcbac271649cab4a | 53% | Unknown | 1 |
| 11 | Gemini 3.8 Flash (High) deepsecbench-aa:8a999846-4c1d-4ce7-a8b7-1310a7166fd7config_ea7eac4b18f0b6869b68409457a9647c12b4868d8c59b627ace49396a5fd8c4c | 38% | Unknown | 1 |
| 12 | Muse Spark 1.3 (Xhigh) deepsecbench-aa:d5170215-69be-4129-849b-26d8d8825bfcconfig_d08e1de92eee759aca3535135eeea956143676d8e528e55b53aef74335fd963e | 32% | Unknown | 1 |
| 13 | Kimi K3 (Max) deepsecbench-aa:f7d2fc3e-1f7b-405f-818c-07952a4af78fconfig_136b3586b5e330c40a98de92809d63e1b217d9ca38550448df8fa724e845083d | 32% | Unknown | 1 |
| 14 | Qwen3.8 27B (Xhigh) deepsecbench-aa:b01dee41-c62b-48ed-8d16-984adc405e5cconfig_97991e5d00071c023c2aeca1aa27590564ae7ecdf572235d678b2e30dbe17404 | 29% | Unknown | 1 |
| 15 | Qwen3.8 2.4T A95B deepsecbench-aa:8df710d3-9dae-4498-9b4e-9818238e6f31config_28ef97e53dadeaffd8bf2b6d398cecfefec5d52628dd6f48468da2d819d61fa8 | 23% | Unknown | 1 |
| 16 | MiniMax-M3 deepsecbench-aa:277f939a-985b-4b37-859d-b3eabc7c0b26config_714a4e54aa58e532b07b25e41b4c0cd4cf91abb8c681f333ac412a1acd87d6a3 | 0% | Unknown | 1 |
| 17 | Nemotron 3 Ultra 550B A55B (Reasoning) deepsecbench-aa:5b52def2-ac9b-4465-ad80-91ea8079e253config_4051bb5bdcf64e85605487923ef99a98cdb7243c56b3ca171d182dcc45eec753 | 0% | Unknown | 1 |
Source: Artificial Analysis
Explorer evidence
DeepsecBench-AA refusal rate (Artificial Analysis)
Sources differ; shown separately, never averaged. Observed ; fresh until .
| Rank | Configuration | Capability | Uncertainty | Families |
|---|---|---|---|---|
| 1 | Kimi K3 (Max) deepsecbench-aa-refusal:f7d2fc3e-1f7b-405f-818c-07952a4af78fconfig_0a3de7ae926aa3dcc68385341bbd44d5c10aa63a1fc1ca8efd5554f6b17f579d | 100% | Unknown | 1 |
| 2 | Gemini 3.8 Flash (High) deepsecbench-aa-refusal:8a999846-4c1d-4ce7-a8b7-1310a7166fd7config_0dfa3cf1d51c5d92c3d2c39dcd046aa4ca1544f0ba358e7d61641256e9676bdb | 100% | Unknown | 1 |
| 3 | GPT-6 Luna (Max) deepsecbench-aa-refusal:6fb13851-40ce-4bda-ad3f-6b38e0c5daa7config_2781563178ea87f697b5ef1547353605d2791b615a8e30f9273b109440c7dd8d | 100% | Unknown | 1 |
| 4 | Claude Fable 5.1 (Max, Default Fallback) deepsecbench-aa-refusal:3e87c73e-a257-495e-9730-367a66229811config_3ce13e6f64478ae3785a8ef03d92466f1c60114a0557b3bede00c96287e3b30b | 100% | Unknown | 1 |
| 5 | GLM-5.3 (Max) deepsecbench-aa-refusal:cd684ea4-b475-4269-b001-d469d06d8a7aconfig_45ac5ec7fc62283ed01851f5e7762582f72e8fcf00b61e460c643f0d3cf0c52b | 100% | Unknown | 1 |
| 6 | GPT-6 Astra (Max) deepsecbench-aa-refusal:2f339a97-9a0d-499a-9cb5-e0db665bfa25config_77e8f98ed607d567b5b390b16afb99648862dbfc382dd8041574c9f2f8d01b2a | 100% | Unknown | 1 |
| 7 | Muse Spark 1.3 (Xhigh) deepsecbench-aa-refusal:d5170215-69be-4129-849b-26d8d8825bfcconfig_7ae3994713dd69d0d473ebc4a1cc211962f5e4069c77f53eb3694814727a0adf | 100% | Unknown | 1 |
| 8 | DeepSeek V4.1 Flash (Max) deepsecbench-aa-refusal:dbe7c625-3100-4463-b479-a228c41f75ddconfig_7ceaad766df1e30415695f76afc0ace630be8f5ab841bdb12109691391b26e7d | 100% | Unknown | 1 |
| 9 | Grok 4.7 (Xhigh) deepsecbench-aa-refusal:59627802-1546-422c-9a65-65b61c022d36config_8d37fb5a1da6611a1c7282043af8e89647122e98ba802a52fc5c35569dc606d3 | 100% | Unknown | 1 |
| 10 | MiniMax-M3 deepsecbench-aa-refusal:277f939a-985b-4b37-859d-b3eabc7c0b26config_ae04d35b1e8a141aac01f35489fe47b67c5b0990805d661b11482ebc92f91ec1 | 100% | Unknown | 1 |
| 11 | GLM 5.3 Flash deepsecbench-aa-refusal:19496b81-9f41-4214-a77a-1df803b3c5aeconfig_afac5efafa6205fb92e1275c654aaea3c767963df3dbe3df8ffd73fc3b58f1ec | 100% | Unknown | 1 |
| 12 | Claude Opus 5.5 (Max, Default Fallback) deepsecbench-aa-refusal:2f3c4dc9-a450-4303-8697-0237257cf08fconfig_bb4777e156ea364dc9e60bf192e9c2114efc9840143170693825aa4d01cf343b | 100% | Unknown | 1 |
| 13 | MiMo-V2.6-Pro deepsecbench-aa-refusal:24d8fdfe-6241-424e-b7b7-1b6efb06e4fbconfig_c72d8c31d3c5709570f9b958fe41592a713c410086dd4c2d163491db12d0a9ff | 100% | Unknown | 1 |
| 14 | Nemotron 3 Ultra 550B A55B (Reasoning) deepsecbench-aa-refusal:5b52def2-ac9b-4465-ad80-91ea8079e253config_f85080543133be18f393b75596f4092260b68af65b1b03d2602fdff575610e68 | 100% | Unknown | 1 |
| 15 | Qwen3.8 27B (Xhigh) deepsecbench-aa-refusal:b01dee41-c62b-48ed-8d16-984adc405e5cconfig_330c0fde8078cdf099c7259327cd928aa671dff22a679cc6e53f660ecbf80129 | 62% | Unknown | 1 |
| 16 | GPT-5.6 Terra (Max) deepsecbench-aa-refusal:bcf8db0a-3bb6-4d82-9516-0f57370c85a6config_49056d6b3f62e2a8a0e42e4673f14ba4af9c41bb9b76f808323bdd90e030050b | 62% | Unknown | 1 |
| 17 | Qwen3.8 2.4T A95B deepsecbench-aa-refusal:8df710d3-9dae-4498-9b4e-9818238e6f31config_3085ceffc621bb82821def04f62ca0f912778fe91ec524d96900a4cccfb7ae90 | 0% | Unknown | 1 |
Source: Artificial Analysis
Not enough independent evidence for a top set
- Calibration has not been validated
- Configuration overlap is below the required threshold
- Independent benchmark-family coverage is below the required threshold