9月4日(星期五),以阿里巴巴大语言模型 Qwen 为核心,汇聚生成式 AI 最新技术与实际应用案例的 QwenMeetupTokyo 举行。
活动当天,Shisa.AI 联合创始人之一沈佳登台分享了 Shisa.AI 目前在 Speech Recognition(语音识别)领域的工作,以及新开发的 Cost Of Solving Programming Assignments(COSPA)基准测试。
COSPA 旨在让“解决编程任务所需的成本”变得可衡量。目前已经有许多排行榜可以展示哪些模型能够取得更高的分数,但这些排行榜并没有告诉我们:达到这样的成绩究竟需要花费多少成本。因此,Shisa.AI 开发了一个同时评估这一成本的基准测试。
COSPA 使用了 300 多个真实世界的 Agentic Tasks(智能体任务),完成全部评测至少需要一天的实际运行时间。通过这一基准测试,现在不仅可以比较哪个模型更聪明、性能更强,还可以进一步比较达到这一性能水平究竟需要投入多少成本和计算资源。
欢迎前往COSPA GitHub 仓库了解详情并尝试使用。
News
全部文章 更多新闻
研究
Shisa 7B 发布
一款基于合成数据驱动方法的双语通用聊天模型。
阅读全文 研究
Shisa-Gamma-7b-v1 下载量突破 100 万次
在作为演化模型合并的核心底座发布一年后,我们的模型达成这一重要里程碑。
阅读全文