shisa.ai
ニュース一覧に​戻る
リサーチ

Shisa AI、​新たに​ベンチマーク​「COSPA」を​公開

プログラミング課題を​解く​ための​コストを​評価する​新たな​ベンチマークを​公開しました。

9月4日(金)、​Alibabaが​開発する​大規模言語モデル​「Qwen」を​中心に、​生成AIの​最新技術や​実践的な​活用事例を​共有する​イベント​「QwenMeetupTokyo」が​開催されました。

イベントでは、​Shisa AI創業者の​一人である​Jia Shenが​登壇。​Shisa AIが​現在取り​組んでいる​Speech Recognition​(音声認識)の​ほか、​新たに​Cost Of Solving Programming Assignments​(COSPA)と​いう​ベンチマークを​構築した​ことを​発表いたしました。

COSPAは、​プログラミング課題を​解く​ための​コストを​明確に​した​ものです。​「どの​モデルが​最も​高い​スコアを​出したか」の​ランキングは​多く​存在していますが、​「その​スコアに​到達するまでに​どれだけの​コストが​かかったのか」までを​示してはいませんでした。​Shisa AIでは、​その​コストまで​評価できる​ベンチマークを​構築しました。

COSPAは​300以上の​実際の​エージェント型タスクを​使用しており、​すべての​評価を​一通り実行するには、​実時間で​少なくとも​1日を​要します。​この​ベンチマークに​より、​「どの​モデルが​一番​賢いか」だけではなく、​「その​性能を​どれくらいの​コストやリソースで​実現したのか」まで​比較が​可能と​なりました。

詳細は​COSPAの​GitHubリポジトリより​ご確認いただけます。​ぜひ​お試しください。

ほかの​ニュース