谷歌发布全新推理模型Gemini 2.0 Flash Thinking 与OpenAI o1竞争

谷歌发布全新推理模型Gemini 2.0 Flash Thinking 与OpenAI o1竞争

谷歌在重新定义人工智能领域的最新举措中,宣布推出 Gemini 2.0 Flash Thinking,这是一种多模式推理模型,能够快速、透明地解决复杂问题。

谷歌首席执行官 Sundar Pichai 在社交网络 X 上的一篇文章中写道,这是“我们迄今为止最周到的模型:)”

在开发者文档中,谷歌解释说,“思考模式的响应推理能力比基础版Gemini 2.0 Flash 模型更强”,而基础版 Gemini 2.0 Flash 模型是谷歌最新、最出色的模型,仅在八天前发布。

新模型仅支持 32,000 个标记输入(约50-60 页文本),并且每个输出响应可以产生 8,000 个标记。在 Google AI Studio 的侧面板中,该公司声称它最适合“多模式理解、推理”和“编码”。

该模型的训练过程、架构、许可和成本的完整细节尚未公布。目前,它在 Google AI Studio 中显示每个令牌的成本为零。

更易于理解和更透明的推理

与 OpenAI 的竞争推理模型o1 和 o1 mini不同,Gemini 2.0 允许用户通过下拉菜单访问其逐步推理,从而更清晰、更透明地了解模型如何得出结论。

谷歌发布全新推理模型Gemini 2.0 Flash Thinking 与OpenAI o1竞争

通过允许用户了解决策过程,Gemini 2.0 解决了人们对人工智能作为“黑匣子”运行的长期担忧,并使该模型(许可条款仍不明确)与竞争对手的其他开源模型相提并论。

我对该模型的早期简单测试表明,它可以正确而快速地(一到三秒内)回答一些对于其他 AI 模型来说非常棘手的问题,例如计算“Strawberry”一词中的 R 的数量。(见上面的截图)。

在另一项测试中,当比较两个十进制数(9.9 和 9.11)时,该模型系统地将问题分解为更小的步骤,从分析整数到比较小数位。

这些结果得到了LM Arena的独立第三方分析的支持,该分析将 Gemini 2.0 Flash Thinking 评为所有 LLM 类别中表现第一的模型。

原生支持图像上传和分析

Gemini 2.0 Flash Thinking 是对竞争对手 OpenAI o1 家族的进一步改进,旨在处理跳跃中的图像。

o1 最初是纯文本模型,但后来扩展到包括图像和文件上传分析。目前,这两种模型也只能返回文本。

根据开发者文档显示,Gemini 2.0 Flash Thinking目前还不支持与谷歌搜索落地,也不支持与其他谷歌应用和外部第三方工具集成。

Gemini 2.0 Flash Thinking 的多模式能力扩展了其潜在用例,使其能够应对结合不同类型数据的场景。

例如,在一项测试中,该模型解决了一个需要分析文本和视觉元素的难题,展示了其跨格式集成和推理的多功能性。

开发人员可以通过 Google AI Studio 和 Vertex AI 利用这些功能,其中模型可供实验。

随着人工智能领域的竞争日趋激烈,Gemini 2.0 Flash Thinking 可能标志着问题解决模型新时代的开始。它能够处理多种数据类型、提供可视化推理并大规模执行,这使它成为推理人工智能市场的有力竞争者,可与 OpenAI 的 o1 系列及其他产品相媲美。

原创文章,作者:王 浩然,如若转载,请注明出处:https://www.dian8dian.com/gu-ge-fa-bu-quan-xin-tui-li-mo-xing-gemini-2-flash-thinking

Like (0)
王 浩然的头像王 浩然作者
Previous 3天前
Next 2天前

相关推荐

发表回复

Please Login to Comment