跳到正文

评价方法

我们的评价如何得出

我们把三个问题分开:这款游戏作为游戏好不好玩、它有多大用处,以及除我们之外还有谁核实过。

首先:这到底是不是一款游戏?

Meaningful Games 不会把每一个夹带课程的数字产品都收进来。第一个问题更窄:如果那份有益的效果消失了,人们还会想玩它吗?

这个问题把游戏和那些只借用了积分、连续打卡、徽章与奖励的应用区分开。一款教育应用可能确实有用,但仅仅有用并不足以进入这个目录。

每款游戏都要满足的条件

四条适用于整个目录的承诺。它们是「是」或「否」,不是量表上的分数,因此没有哪一条能悄悄抬高评价。

游戏优先。以及对自身题材诚实:任何游戏都会简化,能进来的是那种坦承自己在哪里简化、戏剧化或虚构的游戏,而这个界限会写在它的页面上。

获取门槛是事实,不是美德:价格、平台、阅读量,以及年纪较小的玩家需要多少帮助,我们都会公布并做成筛选项,但免费并不会让一款游戏更有用。还有独立性:与团队有关联的游戏会有明显标注,绝不在排序中获得优待,也绝不自动进入任何合集。

一个评价、一个标记、一个外部数字

有用性是我们的编辑评价,共五级。它是对这款游戏结构的判断,不是被测量出来的效果,也不代表游戏好不好。

证据说明除我们之外还有谁核实过。它只是为有用性评价加上限定,从不抬高或压低它。它出现在游戏页面上而不是卡片上,因为这是之后才会问的问题。

玩家反响是我们从商店抄来的数字,连同它原本的格式、评价数量和我们查看的日期。它不是我们给的分。

三个维度

契合,权重 45%:玩法本身要求你运用多少真正的知识或技能?这是最重的维度。在最高处,玩就是做真事:写出能运行的代码、规划一条轨道、构造一个证明。在最低处,收获只是游戏摆出来的一种通用软技能,比如沟通或耐心,或者一个仅仅充当背景的题材。

迁移,权重 30%:你在这里练到的东西,离开游戏还用得上吗?代码、数字逻辑和几何会直接迁移。沿途学到的题材知识会部分迁移。在人为情境中训练出的通用习惯很少能迁移,关于远迁移的研究也是这么说的。

反复,权重 25%:随着难度提升,游戏会不会让你一次次运用这项技能?成百上千小时不断提升的挑战得分最高;一次简短的通关得分很低。只有有价值的部分才算数,所以无休止地重复一项单薄的技能收获不了多少。

易得性与准确性在 2026 年 9 月 14 日之前也在这里,现在被有意移出。获取门槛是公布出来的事实和筛选项;诚实是准入条件和写明的保留意见。

五个等级

卡片上显示的是等级,而不是百分制的数字。等级从内部评分的 85、70、55 和 40 分开始划分,这个评分写在每个游戏页面上、紧挨着各维度的理由,但我们愿意作为判断公开的是等级。我们的门槛刻意定得很高:一款「低」或「极低」的游戏,依然可能非常值得一玩。

卓越:少见。在这里玩就是在一个真实学科里做真事,而且能撑住许多小时。高:一项扎实的技能或一整块知识,在游戏之外依然管用,并且被深入练习过。中等:确实有真材实料,但有明确的限度——一个真实系统被简化成了几个杠杆,或者是在虚构材料上进行的真正推理。

低:真实但狭窄的东西——一种在人为情境中的通用技能,或者一个你更多是在旁观、而不是在真正打交道的题材。极低:一款好游戏,但留不下多少能在别处用上的东西。它在这里是因为值得一玩,而不是因为它能教你什么。

证据:还有谁核实过

有研究支持:已有公开发表的研究考察过这款游戏,或它所依据的这一具体机制。如果某个效果还被独立重复验证过,游戏页面会说明;重复验证是这一级内部的一条注记,而不是更高的一级,因为研究本来就是我们能指向的最有力的东西。

有实践支持:没有公开研究,但要为结果负责的人在用它,例如学校、诊所、博物馆和科研实验室。它与上一级的差别在于种类而非程度:那一级是论文,这一级是实际应用。

仅编辑判断:编辑部之外没有人核实过。这是我们对这款游戏玩法的判断,目录中的大多数都属于这一类。把这一点直说出来,正是这个标记存在的意义。

独立性、人工智能与更正

有关联的游戏会公开标注,绝不在排序中获得优待,也绝不默认进入推荐或合集。完整政策见信息披露页面。

人工智能用于准备和整理工作:元数据、初步分类、结构化摘要、一致性检查和初稿。人工智能不会独立判断历史或科学上的准确性,不会提升证据等级,不会处理利益冲突,也不会发布没有依据的说法。

游戏会变,资料来源也会变。事实或来源方面的问题可以通过更正页面告诉我们;一般的编辑问题请用联系页面。