
Google Images 25周年标志着视觉搜索从简单的文本-图像匹配演变为多模态AI理解的完整周期。2026年Google推出AI Overviews图像生成和全新沉浸式浏览主页,通过Nano Banana模型实现文字直接生成图像,同时Circle to Search支持多物体识别,标志着搜索从"找图"进化为"理解图并创造图"。
2026年7月,Google Images迎来了它的25岁生日。从2001年那个为解决"詹妮弗·洛佩兹绿色连衣裙"搜索需求而诞生的简单图片索引,到今天融合多模态AI、实时视频理解和生成式AI的智能视觉引擎,这25年见证了搜索技术从"文本匹配"到"意图理解"的根本性转变。
回顾Google视觉搜索的发展历程,我们可以清晰地看到一条技术演进的逻辑线:从被动检索到主动理解,从单一模态到多模态融合。
2001年Google Images的诞生源于一个标志性事件——詹妮弗·洛佩兹在格莱美颁奖礼上身穿的绿色范思哲裙引发了全球性的搜索热潮。当时人们不满足于只阅读关于这条裙子的文字描述,他们想亲眼看到它。这一需求直接催生了Google Images,让搜索从纯文本世界进入了视觉世界。
随后十年间,Google不断拓展视觉搜索的边界。2009年的Similar Images功能让用户可以通过点击"寻找相似图片"来细化搜索结果,无需重新输入关键词。2011年的Search by Image则实现了真正的"以图搜图"——用户可以直接上传图片或粘贴图片URL作为搜索词,这标志着图像本身开始成为搜索的输入媒介。
2018年Google Lens的推出是一个转折点。它将搜索能力从桌面和移动浏览器延伸到了物理世界——用户只需用手机摄像头对准任何物体,就能即时获得识别结果、翻译文本或商品链接。这标志着搜索从"输入关键词"演变为"指向现实"。
2022年的Multisearch进一步实现了文本与图像的并行搜索。用户可以对着一张独特的建筑照片提问"这种设计风格受什么启发?",或者拍下社交平台上看到的餐桌并输入"咖啡桌"来寻找相似款。这种"图+文"的组合搜索方式,让表达复杂意图变得前所未有的自然。
2024年推出的Circle to Search则彻底简化了搜索手势——在Android手机屏幕上画个圈、高亮或点按,就能对屏幕上的任何内容进行即时搜索。这一功能目前已覆盖全球超过5.8亿台Android设备。
2025年是视觉搜索与AI深度融合的一年。Lens与AI Mode的结合让搜索具备了深度推理能力,通过"视觉图像扇出"技术,系统能将一张图片的搜索分解为数十个子查询,以全面理解视觉上下文。同年推出的Search Live更是将搜索变成了一场与AI的实时视频对话——用户可以在AI Mode中分享手机实时摄像头画面,边看边问,无论是厨房烹饪指导还是设备故障排查都能得到即时帮助。
2026年,Circle to Search的多物体识别功能再次突破——用户可以在单张图片中同时探索多个物体,通过视觉图像扇出技术瞬间拆解并购物整个场景。
在25周年之际,Google推出了两项面向未来的新功能:
新版Google Images主页是一个动态、沉浸式的图片画廊,实时更新并智能适应用户的兴趣偏好。用户浏览并保存灵感时,这些内容会以标签页形式出现在主画廊上方,方便随时返回继续探索。该功能将在未来几周内向美国英语用户逐步推出。
Google将图像生成直接集成到AI Overviews中,基于最新的Nano Banana模型,用户只需输入简单的文本提示词,就能生成从零开始定制的高质量视觉内容。这填补了"网络上有完美图片"与"所需图片尚不存在"之间的空白。该功能将向所有支持AI Mode图像创建的地区逐步推出。
从Google的25年视觉搜索演进中,我们可以看出几个明确的趋势:
中国科技公司在视觉搜索和多模态AI领域同样进展迅速。百度早在2014年就推出了百度识图,随后发展出以图搜图、拍照搜题等应用场景。字节跳动的豆包大模型在图像理解和生成方面表现突出,其视觉问答能力已整合到抖音、今日头条等产品中。
值得关注的是,国内厂商在视觉搜索的应用场景上走出了差异化路线。例如,淘宝和拼多多将拍照搜商品做到了极致,形成了"所见即所得"的购物闭环;而科大讯飞的讯飞星火则更侧重教育场景的视觉理解,如拍照批改作业、识别公式等。
在生成式AI与搜索结合方面,百度的文心一言和阿里巴巴的通义千问都已支持文生图功能,并开始探索将生成能力整合到搜索体验中。不过,与Google将图像生成深度嵌入AI Overviews的做法相比,国内产品更多地将生成能力作为独立功能呈现,搜索与生成的融合仍在探索阶段。
Google Images的25年,是从"让图片可见"到"让AI理解图片"的25年。随着多模态AI的持续进步,视觉搜索终将演变为一种无处不在的智能交互方式——届时,我们或许不再需要"搜索",而是直接"看见"答案。
Google Images于2001年7月正式推出,最初的灵感来源于詹妮弗·洛佩兹绿色范思哲裙引发的全球搜索热潮,人们希望不仅能读到关于事物的描述,还能直接看到图像。
"视觉图像扇出"(visual image fan-out)是Google在AI Mode中使用的技术,它能够将单张图片的搜索分解为数十个子查询,从而全面理解图像的视觉上下文和场景细节,提供更精准的搜索结果。
2026年Google推出了两项新功能:一是全新的Google Images浏览主页,提供动态、沉浸式的个性化图片画廊;二是将图像生成功能直接集成到AI Overviews中,基于Nano Banana模型,用户可通过文本提示生成定制化图像。
Circle to Search目前支持全球超过5.8亿台Android设备,用户可以通过画圈、高亮、涂鸦或点按等手势,对手机屏幕上的内容进行即时搜索。
Bingdada 是一个专注 SEO、GEO(生成式引擎优化)与 AEO(答案引擎优化)的内容平台,由资深内容编辑、SEO 技术工程师与 AI 研究专家组成的团队持续运营。我们追踪搜索引擎与生成式 AI 的最新动态,为读者提供准确、实用、可落地的方法论与行业洞察。
编辑团队:内容策划 · 技术编辑 · AI 研究组
网站:bingdada.com
© 2026 Bingdada. 保留所有权利。
SEO & GEO 技术探索者,专注于搜索引擎优化和生成式引擎优化。

Google 将生成式 UI 从 AI Mode 扩展至 AI Overviews,用户将在搜索结果中直接看到定制化视觉布局和交互工具。该功能免费开放,预计数周内全面覆盖,对传统工具类网站流量构成挑战。国内厂商在交互式搜索方向亦有布局,但路径不同。

Google 生成式 UI 正从 AI Overviews 向全球扩展,它能直接生成抵押贷款计算器等交互工具,对依赖工具页流量的网站构成直接威胁。本文剖析其能力边界、测试数据与应对策略,并给出国内同类产品视角。

Google 推出五项 AI 搜索学习新功能,包括交互式可视化、定制化测验、Lens 拍照解题、智能笔记本和文件生成,旨在将搜索从信息检索工具转变为主动学习伙伴。
获取最新的 SEO 与 GEO 技术资讯。
我们尊重您的隐私,随时可以取消订阅。