作为生成式AI,如果应用在写作上,会发生什么样的反应?这篇文章,我们来测试一下当前比较强的几款生成式AI产品,看看起能力表现如何?
前面的文章里面我分享了一些运用AI辅助网文创作的思路,回答都是采用GPT4和文心一言两款大语言模型。其实现在市面上的大语言模型很多,对国内的网文作者来说,方便获取的产品除了文心一言,还有腾讯混元助手、阿里通义千问、讯飞星火等。
那么问题来了,面对这么多产品,哪一款在辅助网文创作方面的表现更好?今天我们就来测一测。我选择了5款产品对比,分别是GPT4、文心一言3.5、腾讯混元、通义千问、讯飞星火,其中国内产品的地址如下:
既然要测评写网文的效果,首先我们就需要明确,评价效果的维度和标准是什么?此次测评的思路如下:
接下来我们就看看几款产品的表现吧。
二、测评情况以下是测评问题及各款产品得分情况,为了方便阅读,本文中没有贴完整的问答,只给到得分。
创意类问题主要测试AI提供小说创意的能力,这里准备了6个问题,其中问题1~3用于测试AI基于特定类型(历史、科幻、玄幻)生成创意的能力,问题4~6用于测试AI基于特定情节主题(重生、娱乐圈、规则怪谈)生成创意的能力。
5款产品得分如下:
大纲类问题暂不考虑设定方面的生成,而是以情节主线设计为主,这里准备了6个问题,用于测试AI面向不同主题(复仇、探险、爱情、权谋、悬疑、升级)编排情节的能力。
5款产品得分如下:
人物类问题主要测试AI进行人物设定、以人物为中心的故事创作能力,这里准备了5个问题,用于测试不同类型人物(主角、反派、恋人、伙伴、竞争者)生成能力。
5款产品得分如下:
行文类问题主要测试AI进行小说正文创作的能力,这里准备了7个问题,其中问题18~21用于测试AI的描写(环境、物品、人物、动作)内容生成能力,问题22~24用于测试AI情节(冲突、惊悚、仪式)扩写能力。
5款产品得分如下:
三、测评总结再次声明:针对AI写作的测评缺少绝对客观的量化标准,测评过程中不可避免会有一定的主观性和随机性,所以以上结果仅供参考,大家也可以结合详细的回答来重新评估。
以上即是对5款产品测评的详细情况,按照排名,5款产品的总分情况如下:
按照24个问题的得分分布,这5款产品的雷达图分别如下:
由于每个分类下的问题数量不同,这里我也按照类别重新计算了一下,计算方法是取每个类别得分的平均值,以便于查看每款产品在不同维度的辅助创作能力如何。如此计算出来的得分分布如下:
从此次测评情况来看,可以得出如下结论:
除此以外,文心一言3.5、混元助手、通义千问的表现其实差不太多,没有太多可圈可点的地方。
以上打分与排名主要基于我的判断,有一定主观性。不同作者在创作网文的时候,会有自己的创作偏好和习惯,评价思路或许会和我不同。大家不妨亲自动手试一试,或是拿完整的测评内容自行排序打分,说不定结果会有所差异。
如今,网文已经历了二十多年的发展,早已与传统小说渐行渐远,在构思、行文上都有其独特的方法。针对特定的题材,网文也已经形成一些固有的框架。
生成式AI想要胜任辅助网文创作的工作,还需要更懂网文一些。
专栏作家
不知,*不知,人人都是产品经理专栏作家。B端产品人,擅长产品规划、产品设计等
本文原创发布于人人都是产品经理。未经作者许可,禁止转载。
题图来自Unsplash,基于CC0协议。
该文观点仅代表作者本人,人人都是产品经理平台仅提供信息存储空间服务。
Copyright © 2024 妖气游戏网 www.17u1u.com All Rights Reserved