程式設計
按要求寫程式碼、改程式碼,不藉助代理迴圈,直接給模型的輸出打分。它與「代理式程式設計」不同,後者評的是「模型 + 框架」的整體。 按它在多少項基準裡進入前 10 排序,一樣多時看最好名次。每列保持各自的排名,不做平均。 「—」表示該榜沒有收錄這個模型,不是零分。尚未識別出具體模型的條目不在此處出現,但仍顯示在各自的原始榜單上。
| 模型 | 進入前 10 | Artificial Analysis LLM Leaderboard SciCode | Arena — Code Overall |
|---|---|---|---|
| | 2/2 | #1 66.9% | #1 1813 |
| | 2/2 | #2 63.1% | #5 1744 |
| | 2/2 | #3 61.8% | #8 1678 |
| | 2/2 | #5 61.0% | #3 1774 |
| | 2/2 | #8 59.7% | #10 1657 |
| | 1/2 | #19 56.5% | #2 1786 |
| | 1/2 | #4 61.0% | #17 1625 |
| | 1/2 | #23 55.8% | #4 1755 |
| | 1/2 | #6 60.9% | #16 1629 |
| | 1/2 | #21 56.4% | #6 1691 |
| | 1/2 | #7 59.8% | #25 1592 |
| | 1/2 | #16 57.6% | #7 1688 |
| | 1/2 | #9 59.5% | #11 1654 |
| | 1/2 | #32 54.1% | #9 1674 |
| | 1/2 | #10 59.0% | #18 1622 |