Code review
Results are only compared within a matching group, so a model tested one way is never ranked against a model tested another way.
Review a code change and catch the real bugs it introduces without burying them in invalid or low-value comments
Ranking groups use separate scales. Compare configurations only inside the same group; EvalRank never flattens unlike systems into one leaderboard.
Cross-benchmark consensus
One merged ranking of models by where they place across this topic's benchmark boards. Derived from the boards below, not a calibrated top set; it updates as sources are re-scraped.
| Rank | Model | Score | Benchmarks |
|---|---|---|---|
| 1 | gpt-6.1 sol macroscopebench:medium-effort | 1.241 | 2 |
| 2 | grok 4.6 macroscopebench:medium-effort | 0.969 | 2 |
| 3 | claude opus 5.5 macroscopebench:max-effort | 0.952 | 1 |
| 4 | gpt-6 sol macroscopebench:max-effort | 0.907 | 1 |
| 5 | claude opus 5.5 macroscopebench:xhigh-effort | 0.864 | 1 |
| 6 | gpt-6.1 sol macroscopebench:max-effort | 0.822 | 1 |
| 7 | gpt-6 astra macroscopebench:max-effort | 0.783 | 1 |
| 8 | gpt-5.6 sol macroscopebench:high-effort | 0.745 | 1 |
| 9 | gemini 3.8 flash macroscopebench:medium-effort | 0.744 | 2 |
| 10 | glm 5.3 macroscopebench:max-effort | 0.708 | 1 |
| 11 | gpt-6.1 sol macroscopebench:xhigh-effort | 0.673 | 1 |
| 12 | gpt-6 sol macroscopebench:xhigh-effort | 0.640 | 1 |
| 13 | gpt-6.1 sol macroscopebench:high-effort | 0.608 | 1 |
| 14 | grok 4.6 macroscopebench:xhigh-effort | 0.577 | 1 |
| 15 | grok 4.6 macroscopebench:high-effort | 0.547 | 1 |
| 16 | claude opus 5.5 macroscopebench:medium-effort | 0.534 | 2 |
| 17 | gpt-6 sol macroscopebench:high-effort | 0.519 | 1 |
| 18 | claude opus 5.5 macroscopebench:high-effort | 0.464 | 1 |
| 19 | kimi k3 macroscopebench:max-effort | 0.439 | 1 |
| 20 | gpt-6 luna macroscopebench:max-effort | 0.390 | 1 |
| 21 | gpt-6 sol macroscopebench:medium-effort | 0.373 | 2 |
| 22 | deepseek v4.1 flash macroscopebench:max-effort | 0.367 | 1 |
| 23 | deepseek v4.1 flash macroscopebench:low-effort | 0.323 | 1 |
| 24 | gpt-6.1 sol macroscopebench:low-effort | 0.302 | 1 |
| 25 | deepseek v4.1 flash macroscopebench:high-effort | 0.281 | 1 |
| 26 | claude opus 5 macroscopebench:high-effort | 0.242 | 1 |
| 27 | glm 5.3 macroscopebench:high-effort | 0.224 | 1 |
| 28 | claude opus 5 macroscopebench:medium-effort | 0.200 | 2 |
| 29 | kimi k3 macroscopebench:high-effort | 0.188 | 1 |
| 30 | gpt-6 luna macroscopebench:xhigh-effort | 0.171 | 1 |
| 31 | gpt-5.6 sol macroscopebench:low-effort | 0.155 | 1 |
| 32 | gpt-6 luna macroscopebench:high-effort | 0.139 | 1 |
| 33 | gpt-6 luna macroscopebench:medium-effort | 0.108 | 2 |
| 34 | gpt-6 sol macroscopebench:low-effort | 0.093 | 1 |
| 35 | claude opus 5.5 macroscopebench:low-effort | 0.079 | 1 |
| 36 | claude opus 5 macroscopebench:low-effort | 0.065 | 1 |
| 37 | grok 4.6 macroscopebench:low-effort | 0.051 | 1 |
| 38 | glm 5.3 macroscopebench:low-effort | 0.038 | 1 |
| 39 | kimi k3 macroscopebench:low-effort | 0.025 | 1 |
| 40 | gemini 3.8 flash macroscopebench:low-effort | 0.012 | 1 |
| 41 | gpt-6 luna macroscopebench:low-effort | 0.000 | 1 |
Agent system ยท Agentic
Exploratory - not a ranked winner yetrg-code-review-agent-system-agentic-agent-system-v1Explorer evidence
MacroscopeBench, every reasoning effort (Macroscope)
Sources differ; shown separately, never averaged. Observed ; fresh until .
| Rank | Configuration | Capability | Uncertainty | Families |
|---|---|---|---|---|
| 1 | Claude Opus 5.5 macroscopebench:max-effortconfig_e6d73883b79a458bb42954a12f9a4bd2f61b19d1a69dbedddcee57a7ccfc3a20 | 100% | Unknown | 1 |
| 2 | GPT-6 Sol macroscopebench:max-effortconfig_8355540786508f62b7649c7e41ab7c7c3840eb783dc6fa18f30fa4ebf7f69482 | 91% | Unknown | 1 |
| 3 | Claude Opus 5.5 macroscopebench:xhigh-effortconfig_8b30978b3842998bf9bbb38614b78c91c8e326d7807192a9af2c2988cda4e00f | 87% | Unknown | 1 |
| 4 | GPT-6.1 Sol macroscopebench:max-effortconfig_78df30b801e7eb04d6ef351803a5b54130f7c6a7b4d5ff9aa9756422418d076d | 86% | Unknown | 1 |
| 5 | GPT-6 Astra macroscopebench:max-effortconfig_a75d727f10d4a0eac19d6e01bf487c6184e8a510672183ea02a01a5fc23f3c8f | 85% | Unknown | 1 |
| 6 | GPT-5.6 Sol macroscopebench:high-effortconfig_99f8f7f0f456b8c6d1df1fa7043c58df55379cef41fa8a486e932ad43c3dfaca | 84% | Unknown | 1 |
| 7 | GLM 5.3 macroscopebench:max-effortconfig_483032ccc1d3f89ac4535ef6e623763c1cf3e47b0f87f7636ef89ca557e32604 | 83% | Unknown | 1 |
| 8 | GPT-6.1 Sol macroscopebench:xhigh-effortconfig_82926d8185ff4aefa885e0248125762b7364ee16ea39e3de6323d76c6420dbfb | 83% | Unknown | 1 |
| 9 | GPT-6 Sol macroscopebench:xhigh-effortconfig_b5112dbc3d69b149f10e0a3d43ec90644a4a03cb6431d7441b6cd137f4d727e3 | 83% | Unknown | 1 |
| 10 | GPT-6.1 Sol macroscopebench:high-effortconfig_5a24f76c989220b98e8d8a772ebe10c60ec362db74a637fec8cbe6db7ddc6300 | 82% | Unknown | 1 |
| 11 | Grok 4.6 macroscopebench:xhigh-effortconfig_40f36156eaa01fa3d0fa03fe65b5d085cd5e91e64eeff83efcb02980d3ba0628 | 80% | Unknown | 1 |
| 12 | Grok 4.6 macroscopebench:high-effortconfig_9c445642dfb058b00be7b564987b4f27af2bff78275a8d43bda504fd245abf43 | 78% | Unknown | 1 |
| 13 | GPT-6 Sol macroscopebench:high-effortconfig_e25f44e408a733401428874642e5edfe2bf935f05a41052f7ab74ee0fbb99318 | 76% | Unknown | 1 |
| 14 | GPT-6.1 Sol macroscopebench:medium-effortconfig_9dafacf26cdd886ba1c1f49d87065b7d3f5cd54feb06f8ad8d6638188d37d663 | 73% | Unknown | 1 |
| 15 | Claude Opus 5.5 macroscopebench:high-effortconfig_733dd5cc9437841e5449fa06b422c17e83334f55168c2f5d5b9325a535289ffc | 72% | Unknown | 1 |
| 16 | Kimi K3 macroscopebench:max-effortconfig_fc2b52a594c8a99a3b7c2b59e1391c3c83620d834ea81943588d979eda112be6 | 72% | Unknown | 1 |
| 17 | Grok 4.6 macroscopebench:medium-effortconfig_10f0ba0fa4acbaba4d1227648e8a00f2cb7bc77f44f64a7b4ccf1880e161daf2 | 72% | Unknown | 1 |
| 18 | GPT-6 Luna macroscopebench:max-effortconfig_3c0dd5fe33609fcaddb22f06a3e078e4f268b2003568cc116ae7eb7384151607 | 71% | Unknown | 1 |
| 19 | DeepSeek V4.1 Flash macroscopebench:max-effortconfig_1b29e838bc883e7f200532f0c15b9414fcb38a2e33e878b81ffa9203b1f651e2 | 70% | Unknown | 1 |
| 20 | Gemini 3.8 Flash macroscopebench:medium-effortconfig_9da81bf684efbe1ad1948d51b5b78cb6cd93e9dad9c50d8fc7887883e3a32b50 | 66% | Unknown | 1 |
| 21 | DeepSeek V4.1 Flash macroscopebench:low-effortconfig_ce17896acd252f51af585df90ee2ec0e3d45888ceb07c6a1dd33a711252d6ed4 | 66% | Unknown | 1 |
| 22 | GPT-6.1 Sol macroscopebench:low-effortconfig_7c8deb8f693e6c268a2313d787bf120b0ea2e5f62cd4f1417060353ee57317f8 | 66% | Unknown | 1 |
| 23 | DeepSeek V4.1 Flash macroscopebench:high-effortconfig_2b2e93dfccd56f89985469205995a700afa68ca234cb33876dd8bebc4d1b4b49 | 66% | Unknown | 1 |
| 24 | Claude Opus 5.5 macroscopebench:medium-effortconfig_81b476353cd67c47751bf44dac77ad0f9eee84f3498f3c8b89f694420f430ff3 | 65% | Unknown | 1 |
| 25 | Claude Opus 5 macroscopebench:high-effortconfig_88f804bb21b203128d39a5f2c65aac58f46eaf269947654a8c16b50f2d1a8219 | 64% | Unknown | 1 |
| 26 | GLM 5.3 macroscopebench:high-effortconfig_f8c73c8a27ed8ec1ddba264606a44cea6f03daac9b87b51d8be381f565cbeb04 | 63% | Unknown | 1 |
| 27 | GPT-6 Sol macroscopebench:medium-effortconfig_60c27177bb62cbb0bc1a1315c3195c7739acd13b0107510df793d173238ae34f | 63% | Unknown | 1 |
| 28 | Kimi K3 macroscopebench:high-effortconfig_9197026ae1add69be5447726f323c3b6df043eaf50ff17785efd62297e0def15 | 61% | Unknown | 1 |
| 29 | GPT-6 Luna macroscopebench:xhigh-effortconfig_88e3c4fc4945be6778e224c4012ab03451b10e72c22e0ee09ea2182d94eb2703 | 60% | Unknown | 1 |
| 30 | GPT-5.6 Sol macroscopebench:low-effortconfig_accd884ef51fabc161a52d15d9b4db38cca243783d42ed7108a2f8b5d73a3402 | 55% | Unknown | 1 |
| 31 | GPT-6 Luna macroscopebench:high-effortconfig_82058abb9bbc34aa1c34ae904cca0e264290b8f3b3f4e00bd6a94f4416e17652 | 53% | Unknown | 1 |
| 32 | Claude Opus 5 macroscopebench:medium-effortconfig_88aafab5a5dd6c8836dce41a23b99df08d5a0740972946670a44b907435db23b | 53% | Unknown | 1 |
| 33 | GPT-6 Luna macroscopebench:medium-effortconfig_29792f84f3e1cb2bc35c50d8e07675f7a7d08a8e1772251c5544842835e305ba | 45% | Unknown | 1 |
| 34 | GPT-6 Sol macroscopebench:low-effortconfig_ef2e7cca45952dfa1c5f5bb88e5a50eb9988bf57d5be8e41595685154337e61f | 44% | Unknown | 1 |
| 35 | Claude Opus 5.5 macroscopebench:low-effortconfig_0c2ade372c70318cb921a18ade2cfc1572dc5691bf9b7db84d5b9bb1f4c19160 | 43% | Unknown | 1 |
| 36 | Claude Opus 5 macroscopebench:low-effortconfig_db91574819230d1677188be05a134058093d98912c162f534aff9147cb2b76e9 | 38% | Unknown | 1 |
| 37 | Grok 4.6 macroscopebench:low-effortconfig_3368cc140fbfd7ce4dadd75a37bb9e79ffa5019153bd0554318a22c185f860cb | 32% | Unknown | 1 |
| 38 | GLM 5.3 macroscopebench:low-effortconfig_888ee1fd139c4c552ceab0300b8ab5cd4d374e6a23f8b8f36006393e328f593b | 25% | Unknown | 1 |
| 39 | Kimi K3 macroscopebench:low-effortconfig_7aab349be7a0f827ef808b8c22a1e74af5ea0f2d625d7b523b9fb39ed3d32db7 | 22% | Unknown | 1 |
| 40 | Gemini 3.8 Flash macroscopebench:low-effortconfig_02e963f4bb6cd6a43724fd3a7e10a67dc2f157f877b244978c1d858c2e24d18d | 17% | Unknown | 1 |
| 41 | GPT-6 Luna macroscopebench:low-effortconfig_246e3f618910cca9f31cb112d2ec39ccdad228a931a1c22d0b5fd7430147faaf | 0% | Unknown | 1 |
Source: Macroscope
Explorer evidence
MacroscopeBench, medium effort (Macroscope)
Sources differ; shown separately, never averaged. Observed ; fresh until .
| Rank | Configuration | Capability | Uncertainty | Families |
|---|---|---|---|---|
| 1 | GPT-6.1 Sol macroscopebench:medium-effortconfig_9dafacf26cdd886ba1c1f49d87065b7d3f5cd54feb06f8ad8d6638188d37d663 | 100% | Unknown | 1 |
| 2 | Grok 4.6 macroscopebench:medium-effortconfig_10f0ba0fa4acbaba4d1227648e8a00f2cb7bc77f44f64a7b4ccf1880e161daf2 | 94% | Unknown | 1 |
| 3 | Gemini 3.8 Flash macroscopebench:medium-effortconfig_9da81bf684efbe1ad1948d51b5b78cb6cd93e9dad9c50d8fc7887883e3a32b50 | 75% | Unknown | 1 |
| 4 | Claude Opus 5.5 macroscopebench:medium-effortconfig_81b476353cd67c47751bf44dac77ad0f9eee84f3498f3c8b89f694420f430ff3 | 69% | Unknown | 1 |
| 5 | GPT-6 Sol macroscopebench:medium-effortconfig_60c27177bb62cbb0bc1a1315c3195c7739acd13b0107510df793d173238ae34f | 61% | Unknown | 1 |
| 6 | Claude Opus 5 macroscopebench:medium-effortconfig_88aafab5a5dd6c8836dce41a23b99df08d5a0740972946670a44b907435db23b | 28% | Unknown | 1 |
| 7 | GPT-6 Luna macroscopebench:medium-effortconfig_29792f84f3e1cb2bc35c50d8e07675f7a7d08a8e1772251c5544842835e305ba | 0% | Unknown | 1 |
Source: Macroscope
Not enough independent evidence for a top set
- Calibration has not been validated
- Independent benchmark-family coverage is below the required threshold