让你升值、加薪的11个prompt-新真格基金

频道:投资理财 日期: 浏览:0

未来能打得过GPT-4的中文大模型(LLM)都有谁?

Original 宁四 AI掘金社

2023-06-17 21:00

Posted on 江苏

收录于合集

#ChatGPT

14个

#AI

13个

#OpenAI

4个

#LLM

1个

最近百川智能发布了大模型baichuan-7B,从测评效果上来讲还不错,毕竟从王小川宣布加入大模型混战才2个月,不过比起GPT-4,差距还是很明显的。目前国内的通用大模型风起云涌,那么到底哪些是真正的大模型,哪些是打酱油的,哪些又是噱头呢?

这里就要提到各家大模型的中文基准测评来。

01

最早的中文基准测评

CLUE(www.cluebenchmarks.com)是最早做中文语言理解测评基准,包括代表性的数据集、基准(预训练)模型、语料库、排行榜。

而在早期的CLUE1.1的测评基准下,腾讯、阿里、OPPO、美团都有评测,测评结果基本在2023年之前。

随后,随着大模型混战的开始,CLUE也推出了中文通用大模型综合性基准SuperCLUE,SuperCLUE从三个不同的维度评价模型的能力:基础能力、专业能力和中文特性能力。

基础能力

:包括了常见的有代表性的模型能力,如语义理解、对话、逻辑推理、角色模拟、代码、生成与创作等10项能力

专业能力

:包括了中学、大学与专业考试,涵盖了从数学、物理、地理到社会科学等50多项能力。

中文特性能力

:针对有中文特点的任务,包括了中文成语、诗歌、文学、字形等10项多种能力。

从榜单来讲,GPT-4遥遥领先,而排名靠前的中文大模型包括:

360智脑、讯飞星火、ChatGLM等。

不过,SuperCLUE中基础能力和中文特性占比比较高,比如360智脑在总分上比GPT-4差18分左右,但是在

学术与专业能力

上,比GPT4差了将近30分。

如果说最早的中文基准测评CLUE是测试大模型是否是个“普通人”,那么现在的中文基准测评标准包括SuperCLUE在内测试大规模是否是个“聪明人”。

02

中文考试基准测评

百川智能的baichuan-7B用的测评基准包括:MMLU、C-Eval、AGIEval和GAOKAO-Bench,这也基本上是大模型在测评的时候常用的测评基准,这些基准的特点就是

基于考试构建多任务基准测试

除了MMLU是美国的考试基准测试外,其他都是和中文相关的。

MMLU

:基于美国各种考试构建的多任务基准测试,涵盖小学数学、物理、化学、计算机科学、美国历史、法律、经济、外交等。

目前MMLU测评中排名第一的是GPT-4,排名第2和第3的都是PaLM 2,来自谷歌。

AGIEval

:由微软研究开发的基准测试,用于评估语言模型的能力,包括19个任务集,源自中国和美国的各种考试,例如中国的高考和律师资格考试,以及美国的SAT、LSAT、GRE和GMAT。在19个任务集中,有9个基于中国的高考,我们将其单独列为重要的集合,称为AGIEval(GK)。

C-Eval

:是一个全面的中文基础模型评估套件。它包含了13948个多项选择题,涵盖52个科目,包括数学、物理、化学、生物、历史、政治、计算机和其他学科,以及公务员、注册会计师、律师和医生的专业考试。这个测评基准由交通大学,清华大学和爱丁堡大学联合发布的。

GAOKAO-Bench

:基于中国的高考制定的综合基准测试,包括高考的所有科目。它提供不同类型的问题,包括多项选择、填空和问答。为简洁起见,这个基准测试简称为GAOKAO。

目前公布的排名主要是C-Eval,如下表:

在这个榜单里,

第二名是InternLM

,InternLM是商汤科技与上海人工智能实验室联合香港中文大学、复旦大学、上海交通大学合作开发的多语种大语言模型。这是目前国内已知在C-Eval基准测评下最强的大模型了,

其次是清华&智谱的GLM-130B

,第三是百川智能的baichuan-7B。

不过在AGIEval的基准测评里,InternLM在高考中的测评比GPT-4差不了多少,不过在数学竞赛中的结果是真的弱了一些,简单来说能参加高考,不能参加奥赛。

CubeLM没找到来源,而排在第9和第10的Chinese-Alpaca团队Cui,Yang,and Yao则是来自哈工大讯飞联合实验室首席科学家崔一鸣。

03

中文大模型的商业化应用

从目前针对中文基准测评的情况来分析,GPT-4还是中文大模型商业化应用的最佳选择,没有之一。

对于不方便使用GPT-4的,需要使用国内大模型的,还是要考虑成本,包括本身的tokens成本、效果衍生成本、周边生态附加成本(比如云服务)等等。另外,建议使用单一模态,这样效果会更好。

对于涉及toG端的项目的,更多的考虑是甲方爸爸的想法,当然提前先自测下,比如做一套2023年的高考试卷。

对于其他没有上榜的中文大模型来说,无非是两个原因:

1.出于商业竞争的考虑,不再公开测评。

2.出于面子问题,不能公开测评。

前路漫漫,上下求索。

—— End ——

参考:

https://github.com/InternLM/InternLM-techreport

https://github.com/CLUEbenchmark/SuperCLUE

https://github.com/microsoft/AGIEval

AGIEval- A Human-Centric Benchmark for Evaluating Foundation Models

C-EVAL- A Multi-Level Multi-Discipline Chinese Evaluation Suite for Foundation Models

PaLM 2 Technical Report

MEASURING MASSIVE MULTITASK LANGUAGE UNDERSTANDING

AIGC时代充满各种机会,

「AI掘金社」

完成AIGC内容的基础整理,内容主要两个部分:

1.AI相关数据与资料汇总

序号

数据汇总

说明

1

AI大模型汇总

关注全球特别是

中美

大模型的研究和发布进展

2

AI相关研报汇总

AI

深度

研报实时更新,这些研报都是我读过的,需要下载,请提交申请即可

3

AI创业公司情况

中国AI

明星

创业公司进展,主要是

清华系

明星

人物(比如自带5000万申请出战的)

4

AI人物关注目录

根据

「赛博禅心」

整理,后期会加入国内的AI人物

5

AI相关项目目录

根据

「赛博禅心」

整理,后期会对项目进行分析,并加入国内的项目(国内的小伙伴可以参考复制)

6

AI相关评估标准

什么样的模型、产品才是好的,麻瓜们如何对AI内核进行评估,或许真格基金的Z-bench

7

AI基本术语概念

根据

维基百科

的内容(中英文版)进行关键词梳理,帮助麻瓜们看懂AI内核技术

8

AI行业新闻进展

主要是AI领域科技公司与科研机构技术进展情况以及产品发布情况

9

AI芯片算力情况

汇总国内外硬件厂商在AI芯片研发和产品方面的进展

10

AI软件实操手册

主要搜集汇总ChatGPT/MidJourney等AI软件的付费、升级、使用教程等

2.AI商业化案例拆解汇总

序号

类别

说明

1

账号交易

注册和升级的门槛,国内产品的差距

(车水马龙)

,以及普通用户完全用不到的API接口,都给了商家很好的商业化变现

2

内容创作

无论是利用AI技术实现自媒体创作的高效化,还是将AI技术应用于

自媒体内容创作本身

,AI都会带来不可替代的流量

3

课程销售

课程销售是分层的,无所谓是否是「割韭菜」,能带来

「新认知」

就是「好课程」,而且课程的

ROI

是很高的品类

4

代码销售

技术公司的

套壳ChatGPT

代码销售已经如火如荼了,从API接入的角度来讲并不难,难的是找到客户,此外还包括助用户接入

微信ChatGPT

5

付费社群

「粥佐罗

已经成为

知识星球

的神话了,割韭菜No.1,那又如何,和课程的销售如出一辙,新的思想需要有人播种

链接在此:https://wwwkdw92f7i.feishu.cn/docx/O0hIdFCifo3hU7xJiFQcNTqLnpc

ogp光学影像测量机

ogp光学影像测量机

ogp光学影像测量机

影像测量仪器公司

版权声明:本文内容由互联网用户自发贡献,该文观点仅代表作者本人。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如发现本站有涉嫌抄袭侵权/违法违规的内容, 请发送邮件至 931614094@qq.com 举报,一经查实,本站将立刻删除。