未来能打得过GPT-4的中文大模型(LLM)都有谁?
Original 宁四 AI掘金社
2023-06-17 21:00
Posted on 江苏
收录于合集
#ChatGPT
14个
#AI
13个
#OpenAI
4个
#LLM
1个
最近百川智能发布了大模型baichuan-7B,从测评效果上来讲还不错,毕竟从王小川宣布加入大模型混战才2个月,不过比起GPT-4,差距还是很明显的。目前国内的通用大模型风起云涌,那么到底哪些是真正的大模型,哪些是打酱油的,哪些又是噱头呢?
这里就要提到各家大模型的中文基准测评来。
01
最早的中文基准测评
CLUE(www.cluebenchmarks.com)是最早做中文语言理解测评基准,包括代表性的数据集、基准(预训练)模型、语料库、排行榜。
而在早期的CLUE1.1的测评基准下,腾讯、阿里、OPPO、美团都有评测,测评结果基本在2023年之前。
随后,随着大模型混战的开始,CLUE也推出了中文通用大模型综合性基准SuperCLUE,SuperCLUE从三个不同的维度评价模型的能力:基础能力、专业能力和中文特性能力。
基础能力
:包括了常见的有代表性的模型能力,如语义理解、对话、逻辑推理、角色模拟、代码、生成与创作等10项能力
专业能力
:包括了中学、大学与专业考试,涵盖了从数学、物理、地理到社会科学等50多项能力。
中文特性能力
:针对有中文特点的任务,包括了中文成语、诗歌、文学、字形等10项多种能力。
从榜单来讲,GPT-4遥遥领先,而排名靠前的中文大模型包括:
360智脑、讯飞星火、ChatGLM等。
不过,SuperCLUE中基础能力和中文特性占比比较高,比如360智脑在总分上比GPT-4差18分左右,但是在
学术与专业能力
上,比GPT4差了将近30分。
如果说最早的中文基准测评CLUE是测试大模型是否是个“普通人”,那么现在的中文基准测评标准包括SuperCLUE在内测试大规模是否是个“聪明人”。
02
中文考试基准测评
百川智能的baichuan-7B用的测评基准包括:MMLU、C-Eval、AGIEval和GAOKAO-Bench,这也基本上是大模型在测评的时候常用的测评基准,这些基准的特点就是
基于考试构建多任务基准测试
。
除了MMLU是美国的考试基准测试外,其他都是和中文相关的。
MMLU
:基于美国各种考试构建的多任务基准测试,涵盖小学数学、物理、化学、计算机科学、美国历史、法律、经济、外交等。
目前MMLU测评中排名第一的是GPT-4,排名第2和第3的都是PaLM 2,来自谷歌。
AGIEval
:由微软研究开发的基准测试,用于评估语言模型的能力,包括19个任务集,源自中国和美国的各种考试,例如中国的高考和律师资格考试,以及美国的SAT、LSAT、GRE和GMAT。在19个任务集中,有9个基于中国的高考,我们将其单独列为重要的集合,称为AGIEval(GK)。
C-Eval
:是一个全面的中文基础模型评估套件。它包含了13948个多项选择题,涵盖52个科目,包括数学、物理、化学、生物、历史、政治、计算机和其他学科,以及公务员、注册会计师、律师和医生的专业考试。这个测评基准由交通大学,清华大学和爱丁堡大学联合发布的。
GAOKAO-Bench
:基于中国的高考制定的综合基准测试,包括高考的所有科目。它提供不同类型的问题,包括多项选择、填空和问答。为简洁起见,这个基准测试简称为GAOKAO。
目前公布的排名主要是C-Eval,如下表:
在这个榜单里,
第二名是InternLM
,InternLM是商汤科技与上海人工智能实验室联合香港中文大学、复旦大学、上海交通大学合作开发的多语种大语言模型。这是目前国内已知在C-Eval基准测评下最强的大模型了,
其次是清华&智谱的GLM-130B
,第三是百川智能的baichuan-7B。
不过在AGIEval的基准测评里,InternLM在高考中的测评比GPT-4差不了多少,不过在数学竞赛中的结果是真的弱了一些,简单来说能参加高考,不能参加奥赛。
CubeLM没找到来源,而排在第9和第10的Chinese-Alpaca团队Cui,Yang,and Yao则是来自哈工大讯飞联合实验室首席科学家崔一鸣。
03
中文大模型的商业化应用
从目前针对中文基准测评的情况来分析,GPT-4还是中文大模型商业化应用的最佳选择,没有之一。
对于不方便使用GPT-4的,需要使用国内大模型的,还是要考虑成本,包括本身的tokens成本、效果衍生成本、周边生态附加成本(比如云服务)等等。另外,建议使用单一模态,这样效果会更好。
对于涉及toG端的项目的,更多的考虑是甲方爸爸的想法,当然提前先自测下,比如做一套2023年的高考试卷。
对于其他没有上榜的中文大模型来说,无非是两个原因:
1.出于商业竞争的考虑,不再公开测评。
2.出于面子问题,不能公开测评。
前路漫漫,上下求索。
—— End ——
参考:
https://github.com/InternLM/InternLM-techreport
https://github.com/CLUEbenchmark/SuperCLUE
https://github.com/microsoft/AGIEval
AGIEval- A Human-Centric Benchmark for Evaluating Foundation Models
C-EVAL- A Multi-Level Multi-Discipline Chinese Evaluation Suite for Foundation Models
PaLM 2 Technical Report
MEASURING MASSIVE MULTITASK LANGUAGE UNDERSTANDING
AIGC时代充满各种机会,
「AI掘金社」
完成AIGC内容的基础整理,内容主要两个部分:
1.AI相关数据与资料汇总
序号
数据汇总
说明
1
AI大模型汇总
关注全球特别是
中美
大模型的研究和发布进展
2
AI相关研报汇总
AI
深度
研报实时更新,这些研报都是我读过的,需要下载,请提交申请即可
3
AI创业公司情况
中国AI
明星
创业公司进展,主要是
清华系
和
明星
人物(比如自带5000万申请出战的)
4
AI人物关注目录
根据
「赛博禅心」
整理,后期会加入国内的AI人物
5
AI相关项目目录
根据
「赛博禅心」
整理,后期会对项目进行分析,并加入国内的项目(国内的小伙伴可以参考复制)
6
AI相关评估标准
什么样的模型、产品才是好的,麻瓜们如何对AI内核进行评估,或许真格基金的Z-bench
7
AI基本术语概念
根据
维基百科
的内容(中英文版)进行关键词梳理,帮助麻瓜们看懂AI内核技术
8
AI行业新闻进展
主要是AI领域科技公司与科研机构技术进展情况以及产品发布情况
9
AI芯片算力情况
汇总国内外硬件厂商在AI芯片研发和产品方面的进展
10
AI软件实操手册
主要搜集汇总ChatGPT/MidJourney等AI软件的付费、升级、使用教程等
2.AI商业化案例拆解汇总
序号
类别
说明
1
账号交易
注册和升级的门槛,国内产品的差距
(车水马龙)
,以及普通用户完全用不到的API接口,都给了商家很好的商业化变现
2
内容创作
无论是利用AI技术实现自媒体创作的高效化,还是将AI技术应用于
自媒体内容创作本身
,AI都会带来不可替代的流量
3
课程销售
课程销售是分层的,无所谓是否是「割韭菜」,能带来
「新认知」
就是「好课程」,而且课程的
ROI
是很高的品类
4
代码销售
技术公司的
套壳ChatGPT
代码销售已经如火如荼了,从API接入的角度来讲并不难,难的是找到客户,此外还包括助用户接入
微信ChatGPT
5
付费社群
「粥佐罗
」
已经成为
知识星球
的神话了,割韭菜No.1,那又如何,和课程的销售如出一辙,新的思想需要有人播种
链接在此:https://wwwkdw92f7i.feishu.cn/docx/O0hIdFCifo3hU7xJiFQcNTqLnpc