精选手游网-一个汇聚最新最全软件资源的安全平台
您的位置:首页 > 精选教程 > AI推理模型受热捧,基准测试费用为何水涨船高?

AI推理模型受热捧,基准测试费用为何水涨船高?

  • 时间:2025-04-14 11:42:56
  • 来源:精选手游网
  • 作者:精选手游网
  • 随着人工智能技术日新月异的发展,推理AI模型逐渐成为了科研领域的热门焦点。这类模型能够模拟人类的思考过程,尤其在物理学等专业领域,展现出了超越非推理模型的卓越能力。然而,高昂的测试成本却成为了验证这些模型性能的一大障碍。

    据第三方AI测试机构“人工智能分析”提供的数据,评估不同推理模型的费用差异显著。以OpenAI的o1推理模型为例,在七个主流的AI基准测试中的评估费用高达2767.05美元,折合人民币约20191元。相比之下,Anthropic的Claude 3.7 Sonnet混合推理模型的评估费用为1485.35美元,折合人民币约10839元。而OpenAI的o3-mini-high模型评估则仅需344.59美元,折合人民币约2514元。尽管存在费用较低的模型,如OpenAI的o1-mini评估费用仅为141.22美元,折合人民币约1030元,但整体来看,推理模型的测试成本依然偏高。

    “人工智能分析”机构已投入约5200美元,折合人民币约37945元,用于评估十几种推理模型,这一投入几乎是非推理模型评估费用2400美元的两倍。OpenAI在2024年5月发布的非推理GPT-4o模型评估成本仅为108.85美元,而Claude 3.6 Sonnet的评估成本更是低至81.41美元。该机构的联合创始人乔治·卡梅伦表示,随着推理模型的开发日益增多,测试预算也将相应增加。

    AI初创公司“通用推理”的首席执行官罗斯·泰勒也面临着测试成本上升的挑战。他透露,为评估Claude 3.7 Sonnet,使用了约3700个独特的提示词,费用高达580美元。泰勒估计,仅对MMLU Pro进行一次完整测试的成本就可能超过1800美元。他担忧地指出,随着资源投入的差异,学者可能无法复制实验室的报告结果。

    推理模型测试成本高昂的主要原因在于其生成的token数量庞大。Token是原始文本的片段,如将单词“fantastic”拆分为多个音节。据“人工智能分析”称,在基准测试中,OpenAI的o1模型生成了超过4400万个token,是GPT-4o生成量的八倍。由于大多数AI公司按token收费,因此成本迅速累积。

    现代基准测试包含复杂、多步骤任务的问题,导致模型生成大量token。Epoch AI的高级研究员让-斯坦尼斯拉斯·德内恩指出,尽管每个基准测试的问题数量总体减少,但问题本身更加复杂,旨在评估模型执行现实世界任务的能力,如编写和执行代码、浏览互联网等。最昂贵的模型每百万输出token的成本也在不断增加。例如,Anthropic发布的Claude 3 Opus模型每百万输出token的成本为75美元,而OpenAI的GPT-4.5和o1-pro模型的成本则分别为150美元和600美元。

    德内恩表示,尽管随着技术进步,模型的性能提升且成本有所下降,但评估最大最好的模型仍需支付高昂费用。部分AI实验室,包括OpenAI,为测试目的向基准测试组织提供免费或补贴的模型访问权限,但一些专家担忧这可能影响测试结果的公正性。

    点击排行榜

    近期热点

    本类最新

    Copyright© 2025 All rights reserved. 版权所有 精选手游网 联系我:bbbmo678@126.com

    浙ICP备18049409号-1 网站地图