Code review

Results are only compared within a matching group, so a model tested one way is never ranked against a model tested another way.

Review a code change and catch the real bugs it introduces without burying them in invalid or low-value comments

Ranking groups use separate scales. Compare configurations only inside the same group; EvalRank never flattens unlike systems into one leaderboard.

Cross-benchmark consensus

One merged ranking of models by where they place across this topic's benchmark boards. Derived from the boards below, not a calibrated top set; it updates as sources are re-scraped.

RankModelScoreBenchmarks
1gpt-6.1 sol macroscopebench:medium-effort1.2412
2grok 4.6 macroscopebench:medium-effort0.9692
3claude opus 5.5 macroscopebench:max-effort0.9521
4gpt-6 sol macroscopebench:max-effort0.9071
5claude opus 5.5 macroscopebench:xhigh-effort0.8641
6gpt-6.1 sol macroscopebench:max-effort0.8221
7gpt-6 astra macroscopebench:max-effort0.7831
8gpt-5.6 sol macroscopebench:high-effort0.7451
9gemini 3.8 flash macroscopebench:medium-effort0.7442
10glm 5.3 macroscopebench:max-effort0.7081
11gpt-6.1 sol macroscopebench:xhigh-effort0.6731
12gpt-6 sol macroscopebench:xhigh-effort0.6401
13gpt-6.1 sol macroscopebench:high-effort0.6081
14grok 4.6 macroscopebench:xhigh-effort0.5771
15grok 4.6 macroscopebench:high-effort0.5471
16claude opus 5.5 macroscopebench:medium-effort0.5342
17gpt-6 sol macroscopebench:high-effort0.5191
18claude opus 5.5 macroscopebench:high-effort0.4641
19kimi k3 macroscopebench:max-effort0.4391
20gpt-6 luna macroscopebench:max-effort0.3901
21gpt-6 sol macroscopebench:medium-effort0.3732
22deepseek v4.1 flash macroscopebench:max-effort0.3671
23deepseek v4.1 flash macroscopebench:low-effort0.3231
24gpt-6.1 sol macroscopebench:low-effort0.3021
25deepseek v4.1 flash macroscopebench:high-effort0.2811
26claude opus 5 macroscopebench:high-effort0.2421
27glm 5.3 macroscopebench:high-effort0.2241
28claude opus 5 macroscopebench:medium-effort0.2002
29kimi k3 macroscopebench:high-effort0.1881
30gpt-6 luna macroscopebench:xhigh-effort0.1711
31gpt-5.6 sol macroscopebench:low-effort0.1551
32gpt-6 luna macroscopebench:high-effort0.1391
33gpt-6 luna macroscopebench:medium-effort0.1082
34gpt-6 sol macroscopebench:low-effort0.0931
35claude opus 5.5 macroscopebench:low-effort0.0791
36claude opus 5 macroscopebench:low-effort0.0651
37grok 4.6 macroscopebench:low-effort0.0511
38glm 5.3 macroscopebench:low-effort0.0381
39kimi k3 macroscopebench:low-effort0.0251
40gemini 3.8 flash macroscopebench:low-effort0.0121
41gpt-6 luna macroscopebench:low-effort0.0001

Agent system ยท Agentic

Exploratory - not a ranked winner yet
rg-code-review-agent-system-agentic-agent-system-v1

Explorer evidence

MacroscopeBench, every reasoning effort (Macroscope)

Sources differ; shown separately, never averaged. Observed ; fresh until .

RankConfigurationCapabilityUncertaintyFamilies
1Claude Opus 5.5 macroscopebench:max-effortconfig_e6d73883b79a458bb42954a12f9a4bd2f61b19d1a69dbedddcee57a7ccfc3a20100%Unknown1
2GPT-6 Sol macroscopebench:max-effortconfig_8355540786508f62b7649c7e41ab7c7c3840eb783dc6fa18f30fa4ebf7f6948291%Unknown1
3Claude Opus 5.5 macroscopebench:xhigh-effortconfig_8b30978b3842998bf9bbb38614b78c91c8e326d7807192a9af2c2988cda4e00f87%Unknown1
4GPT-6.1 Sol macroscopebench:max-effortconfig_78df30b801e7eb04d6ef351803a5b54130f7c6a7b4d5ff9aa9756422418d076d86%Unknown1
5GPT-6 Astra macroscopebench:max-effortconfig_a75d727f10d4a0eac19d6e01bf487c6184e8a510672183ea02a01a5fc23f3c8f85%Unknown1
6GPT-5.6 Sol macroscopebench:high-effortconfig_99f8f7f0f456b8c6d1df1fa7043c58df55379cef41fa8a486e932ad43c3dfaca84%Unknown1
7GLM 5.3 macroscopebench:max-effortconfig_483032ccc1d3f89ac4535ef6e623763c1cf3e47b0f87f7636ef89ca557e3260483%Unknown1
8GPT-6.1 Sol macroscopebench:xhigh-effortconfig_82926d8185ff4aefa885e0248125762b7364ee16ea39e3de6323d76c6420dbfb83%Unknown1
9GPT-6 Sol macroscopebench:xhigh-effortconfig_b5112dbc3d69b149f10e0a3d43ec90644a4a03cb6431d7441b6cd137f4d727e383%Unknown1
10GPT-6.1 Sol macroscopebench:high-effortconfig_5a24f76c989220b98e8d8a772ebe10c60ec362db74a637fec8cbe6db7ddc630082%Unknown1
11Grok 4.6 macroscopebench:xhigh-effortconfig_40f36156eaa01fa3d0fa03fe65b5d085cd5e91e64eeff83efcb02980d3ba062880%Unknown1
12Grok 4.6 macroscopebench:high-effortconfig_9c445642dfb058b00be7b564987b4f27af2bff78275a8d43bda504fd245abf4378%Unknown1
13GPT-6 Sol macroscopebench:high-effortconfig_e25f44e408a733401428874642e5edfe2bf935f05a41052f7ab74ee0fbb9931876%Unknown1
14GPT-6.1 Sol macroscopebench:medium-effortconfig_9dafacf26cdd886ba1c1f49d87065b7d3f5cd54feb06f8ad8d6638188d37d66373%Unknown1
15Claude Opus 5.5 macroscopebench:high-effortconfig_733dd5cc9437841e5449fa06b422c17e83334f55168c2f5d5b9325a535289ffc72%Unknown1
16Kimi K3 macroscopebench:max-effortconfig_fc2b52a594c8a99a3b7c2b59e1391c3c83620d834ea81943588d979eda112be672%Unknown1
17Grok 4.6 macroscopebench:medium-effortconfig_10f0ba0fa4acbaba4d1227648e8a00f2cb7bc77f44f64a7b4ccf1880e161daf272%Unknown1
18GPT-6 Luna macroscopebench:max-effortconfig_3c0dd5fe33609fcaddb22f06a3e078e4f268b2003568cc116ae7eb738415160771%Unknown1
19DeepSeek V4.1 Flash macroscopebench:max-effortconfig_1b29e838bc883e7f200532f0c15b9414fcb38a2e33e878b81ffa9203b1f651e270%Unknown1
20Gemini 3.8 Flash macroscopebench:medium-effortconfig_9da81bf684efbe1ad1948d51b5b78cb6cd93e9dad9c50d8fc7887883e3a32b5066%Unknown1
21DeepSeek V4.1 Flash macroscopebench:low-effortconfig_ce17896acd252f51af585df90ee2ec0e3d45888ceb07c6a1dd33a711252d6ed466%Unknown1
22GPT-6.1 Sol macroscopebench:low-effortconfig_7c8deb8f693e6c268a2313d787bf120b0ea2e5f62cd4f1417060353ee57317f866%Unknown1
23DeepSeek V4.1 Flash macroscopebench:high-effortconfig_2b2e93dfccd56f89985469205995a700afa68ca234cb33876dd8bebc4d1b4b4966%Unknown1
24Claude Opus 5.5 macroscopebench:medium-effortconfig_81b476353cd67c47751bf44dac77ad0f9eee84f3498f3c8b89f694420f430ff365%Unknown1
25Claude Opus 5 macroscopebench:high-effortconfig_88f804bb21b203128d39a5f2c65aac58f46eaf269947654a8c16b50f2d1a821964%Unknown1
26GLM 5.3 macroscopebench:high-effortconfig_f8c73c8a27ed8ec1ddba264606a44cea6f03daac9b87b51d8be381f565cbeb0463%Unknown1
27GPT-6 Sol macroscopebench:medium-effortconfig_60c27177bb62cbb0bc1a1315c3195c7739acd13b0107510df793d173238ae34f63%Unknown1
28Kimi K3 macroscopebench:high-effortconfig_9197026ae1add69be5447726f323c3b6df043eaf50ff17785efd62297e0def1561%Unknown1
29GPT-6 Luna macroscopebench:xhigh-effortconfig_88e3c4fc4945be6778e224c4012ab03451b10e72c22e0ee09ea2182d94eb270360%Unknown1
30GPT-5.6 Sol macroscopebench:low-effortconfig_accd884ef51fabc161a52d15d9b4db38cca243783d42ed7108a2f8b5d73a340255%Unknown1
31GPT-6 Luna macroscopebench:high-effortconfig_82058abb9bbc34aa1c34ae904cca0e264290b8f3b3f4e00bd6a94f4416e1765253%Unknown1
32Claude Opus 5 macroscopebench:medium-effortconfig_88aafab5a5dd6c8836dce41a23b99df08d5a0740972946670a44b907435db23b53%Unknown1
33GPT-6 Luna macroscopebench:medium-effortconfig_29792f84f3e1cb2bc35c50d8e07675f7a7d08a8e1772251c5544842835e305ba45%Unknown1
34GPT-6 Sol macroscopebench:low-effortconfig_ef2e7cca45952dfa1c5f5bb88e5a50eb9988bf57d5be8e41595685154337e61f44%Unknown1
35Claude Opus 5.5 macroscopebench:low-effortconfig_0c2ade372c70318cb921a18ade2cfc1572dc5691bf9b7db84d5b9bb1f4c1916043%Unknown1
36Claude Opus 5 macroscopebench:low-effortconfig_db91574819230d1677188be05a134058093d98912c162f534aff9147cb2b76e938%Unknown1
37Grok 4.6 macroscopebench:low-effortconfig_3368cc140fbfd7ce4dadd75a37bb9e79ffa5019153bd0554318a22c185f860cb32%Unknown1
38GLM 5.3 macroscopebench:low-effortconfig_888ee1fd139c4c552ceab0300b8ab5cd4d374e6a23f8b8f36006393e328f593b25%Unknown1
39Kimi K3 macroscopebench:low-effortconfig_7aab349be7a0f827ef808b8c22a1e74af5ea0f2d625d7b523b9fb39ed3d32db722%Unknown1
40Gemini 3.8 Flash macroscopebench:low-effortconfig_02e963f4bb6cd6a43724fd3a7e10a67dc2f157f877b244978c1d858c2e24d18d17%Unknown1
41GPT-6 Luna macroscopebench:low-effortconfig_246e3f618910cca9f31cb112d2ec39ccdad228a931a1c22d0b5fd7430147faaf0%Unknown1
Compare configurations in this group

Source: Macroscope

Explorer evidence

MacroscopeBench, medium effort (Macroscope)

Sources differ; shown separately, never averaged. Observed ; fresh until .

RankConfigurationCapabilityUncertaintyFamilies
1GPT-6.1 Sol macroscopebench:medium-effortconfig_9dafacf26cdd886ba1c1f49d87065b7d3f5cd54feb06f8ad8d6638188d37d663100%Unknown1
2Grok 4.6 macroscopebench:medium-effortconfig_10f0ba0fa4acbaba4d1227648e8a00f2cb7bc77f44f64a7b4ccf1880e161daf294%Unknown1
3Gemini 3.8 Flash macroscopebench:medium-effortconfig_9da81bf684efbe1ad1948d51b5b78cb6cd93e9dad9c50d8fc7887883e3a32b5075%Unknown1
4Claude Opus 5.5 macroscopebench:medium-effortconfig_81b476353cd67c47751bf44dac77ad0f9eee84f3498f3c8b89f694420f430ff369%Unknown1
5GPT-6 Sol macroscopebench:medium-effortconfig_60c27177bb62cbb0bc1a1315c3195c7739acd13b0107510df793d173238ae34f61%Unknown1
6Claude Opus 5 macroscopebench:medium-effortconfig_88aafab5a5dd6c8836dce41a23b99df08d5a0740972946670a44b907435db23b28%Unknown1
7GPT-6 Luna macroscopebench:medium-effortconfig_29792f84f3e1cb2bc35c50d8e07675f7a7d08a8e1772251c5544842835e305ba0%Unknown1
Compare configurations in this group

Source: Macroscope

Not enough independent evidence for a top set
  • Calibration has not been validated
  • Independent benchmark-family coverage is below the required threshold
Back to all kinds of work