跳到内容
AI工具

Google Gemini使用指南:功能详解与对比

Google Gemini AI完整指南。功能介绍、实用技巧及与其他AI工具的对比。

6 篇文章

排序文章以找到您需要的内容

Gemini 分类下的文章

Gemini“发生错误 (13)”的原因与解决方法——出现错误 13 时的排查顺序

Gemini“发生错误 (13)”的原因与解决方法——出现错误 13 时的排查顺序

在 Gemini 中发送消息后,显示“发生错误 (13)”“Something went wrong(13)”并卡住——对于这个错误的原因,Google 没有在官方帮助中说明。不过,2026年5月的官方故障报告中有这条提示持续出现约4天的记录,原因是数据库资源不足与应用缺陷,临时解决方法为“无”。本文结合这份官方记录,以及编号“13”与 gRPC 的内部错误(INTERNAL)一致这一点(Google 并未明确表示两者含义相同),整理官方社区中常见的4种情形——所有人同时出现、只有长对话、只在附加图片时、只有特定账号。在此基础上,从确认故障信息、接续到新对话、换账号确认,到通过反馈报告,按省事程度给出7步排查顺序。

ChatGPT、Claude、Gemini 的自定义指令在哪里?字数上限与管用的写法

ChatGPT、Claude、Gemini 的自定义指令在哪里?字数上限与管用的写法

不必每次都叮嘱“先说结论”“用中文回答”,只要在对所有对话自动生效的指令栏里写一次就行。ChatGPT 的“自定义指令”、Claude 的“Claude的说明”、Gemini 的“给 Gemini 的指令”就是这样的栏位,但三家的界面名称、所在位置、能写的字数都不一样。ChatGPT 的 Free 和 Go 为 1,500 个字符,Plus 及以上为 5,000 个字符(2026年7月提高),Claude 和 Gemini 没有公布上限。本文在三家官方帮助页面上核实位置与上限,并依据 Anthropic 的官方提示词指南给出管用的写法与示例。此外,还把官方帮助页面明确写出的“指令不生效的场景”——项目中、Gem 中、临时聊天、公司账号等——整理成一份检查清单。

GPT-5.6 Sol vs Gemini 3.1 Pro 全面对比:智能体编码 vs 原生多模态

GPT-5.6 Sol vs Gemini 3.1 Pro 全面对比:智能体编码 vs 原生多模态

OpenAI 旗舰 GPT-5.6“Sol”与 Google Gemini 的对决,是一场强项几乎不重叠的比拼:Sol 在终端·智能体编码上压倒性领先,Gemini 则以原生多模态(语音·视频)、约半价的价格以及 MMLU/ARC-AGI-2/WebDev Arena 抗衡。需要注意时态陷阱——Google 真正的对手 Gemini 3.5 Pro 在本文时点尚未发布(预计7月中旬 GA),因此公正的比较对象是现行旗舰 Gemini 3.1 Pro。本文依据官方发布与独立基准,梳理两者的实力、价格、多模态以及按场景的选择方式。

什么是 Google Gemini?与 Google 生态深度融合的多模态 AI

什么是 Google Gemini?与 Google 生态深度融合的多模态 AI

向 AI 提问,就能获得基于 Google 搜索最新信息的回答——并与 Gmail、Docs、YouTube 无缝衔接。这就是 Google Gemini 的世界。Gemini 是 Google 打造的对话式 AI(以及背后的模型家族),广泛嵌入到移动应用、Web、Google Workspace 和 Android 中,并在文本、图像、音频与视频之间实现多模态。模型分为“快又便宜的 Flash 系列”和“聪明的 Pro 系列”——最新是 Gemini 3.8 Flash 与 3.1 Pro。价格为 Free / Plus 7.99 美元 / Pro 19.99 美元 / Ultra 99.99 美元(Ultra 从 249.99 美元下调),2026 年转向基于算力的用量限制。本文以 2026 年 5 月的信息梳理模型阵容、核心功能(Deep Research、Gems、Canvas、Live、Deep Think)、三大强项(Google 整合、长上下文、多模态)、价格,以及与 ChatGPT、Claude 的差异。

什么是多模态AI?——文本/图像/音频/视频统一架构与选型基准

什么是多模态AI?——文本/图像/音频/视频统一架构与选型基准

2026年4月,多模态基准MMMU-Pro在GPT-5.5、Claude Opus 4.7、Gemini 3.1 Pro与Qwen 3.5 Omni上同时达到81–83%——图像理解实际上已经饱和。架构已从拼接式(独立编码器+适配器)迁移至原生全模态(所有模态作为共享token流)。本文涵盖什么是多模态AI(LMM/VLM/Omnimodal)、架构分水岭及其意义、各模态的强弱在技术上由什么决定(视频、音频、文档/UI、开放权重模型)以及2026年5月的对比快照、值得关注的四个基准(MMMU-Pro、Video-MMMU、DocVQA、AudioBench)、五种用例各自该依据什么标准来选,以及三条硬性局限(低质量图像的猜测、视频中段准确率、方言与术语音频)——以最新研究与实操经验为依据。