
针对谷歌, CEO公开宣称, 75%的新增代码是由AI生成的, 然而内部数据却显示, 实际占比仅仅约为30%, 并且大量生成的代码属于“需返工的半成品”。这个内部数据跟CEO桑达尔·皮查伊公开所描绘的AI编程蓝图, 形成了鲜明的反差。在管理层把AI辅助编程当作研发效率大幅度增长的关键成就来考量之际, 身处一线的工程师却遭遇了“代码审核员”这般的艰难处境, 他们忍不住会这样去思考: 在AI生成代码看似繁荣的表象背后, 实际的工作效率到底是得到了提高, 还是陷入到了更深的麻烦当中? ## 谷歌内部交流平台Memegen上, 内部工程师呈集体性的不满言语以及“AI代码质检”所面临的困境, 在最近一年的时间里, 出现了数量从数百到数千张不等的, 用来挖苦讽刺AI编程工具的梗图。每当有新的产品推出或者自研的工具Jetski出现故障的时候, 这些带有吐槽性质的内容就会出现数量上的“大幅增加”。有一张梗图采用了谷歌发布会舞台演示的截图, 在这张图里, “slop(垃圾)”这个词被粗劣地张贴在了演示屏幕之上, 并且配有文字说明: “I/O宣布了制造垃圾内容的全新方式。” 就是这样一张图, 得到了其他员工**100多个点赞**。还有另外一张梗图, 它取笑了管理层对AI的过度热衷,具体表现为: 一条长着大脑袋的鱼挤到身旁是一名潜水员的位置, 鱼所配的文字是: “你不用AI吗? 谁还会花这么多时间? AI是魔法, 你是麻瓜吗? 今天刚推出了新的最佳AI工具。”。潜水员身上所写的文字是: “正在工作的我。”, 这些梗图的背后, 存在着工程师们在面对AI生成代码时的, 真实的无奈与压力。一位谷歌内部的技术人员介绍说, AI工具虽然能够快速且批量地产出代码, 然而生成的代码普遍存在质量差异较大参差不齐、规范性欠缺不足的情况。原本由程序员承担的编码工作量遭到了压缩, 而繁重的校验、修改、测试压力却被转移到了后续环节。一名出自小型网页设计公司的软件开发者讲述了相近困境, “AI生成的代码出现更多bug……更让人崩溃的是, 我的一位同事借助AI生成了数量巨大的代码, 每次交给我进行review时都是上千行的pull request, 我得耗费极多时间去检查。”在谷歌, 这种压力被具体化为一张呈现“芭本海默”风格的梗图, 芭比那一侧轻松愉悦, 配有文字“CL作者运用vibe coding进行大规模改动”;奥本海默那一侧神情凝重, 配有文字“代码审查员”。工程师们反馈AI代码存在隐性缺陷, AI生成的代码问题主要分为几类, “看起来都对, 细看全是坑”, 其中最典型的是业务逻辑隐性漏洞, 一位开发者分享了一个支付接口案例, AI生成的代码看起来测试用例齐全, 然而上线后回调报错, 原因是AI在注释里写了“// TODO: change to production URL before deploy”, 而从未处理这个关键提示, 致使线上环境使用了测试地址。更常见的情形是, AI会生成貌似完整的支付处理函数, 然而会遗漏金额验证以及重复支付检测等核心业务校验逻辑, 随后直接调用支付网关接口。除此之外是因上下文丢失致使的逻辑冲突。由于受限于模型上下文窗口, AI在处理大型项目之际容易顾此失彼。比如说, 在一个有两万多行的订单模块当中添加优惠码校验时, AI工具错误地修改了优惠券叠加的公共函数, 进而导致原有功能在集成测试的时候失效。这些问题直接对研发流程的效率造成了冲击。所呈现的数据表明了, 初级工程师依靠着AI, 在单日能够提交数量为10至15个的代码合并请求也就是PR , 可是呢, 审定一个具备高质量的PR依旧得花费30分钟 , 其结果便是, 资深工程师的工作重点从有着创造性的开发转变至“AI代码质检员”, 审核出现积压进而成为新的瓶颈 , 整个项目全流程耗时并没有达成有效的缩减, 甚至是因为后续校验工作的增多而被拉长 , ## 面对内部存在的巨大声浪, 谷歌管理层并不是毫无反应的。以2026年5月那次采访为契机, 皮查伊予以承认, 谷歌于AI编程那里, 在工具使用这方面情况之下, 于指令遵循这个范畴内, 以及长周期任务处理这般情形之中, 是存在显著短板的。他表明, 往昔针对开发者所存在的AI工具, 像Gemini Code Assist、Gemini CLI等等这类, 是比较分散的, 欠缺统一入口以及贴近真实开发流程的数据流设计。鉴于此, 谷歌采取了一系列措施。组织层面, Google DeepMind构建了以研究员Sebastian Borgeaud来牵头处理的, 名为**AI编码模型专责行动小组**, 把资源聚集起来去改进Gemini的代码生成方面的能力。产品方面, 谷歌尝试着把能力融合到Antigravity平台里, 塑造出一个统一的AI编程Agent入口。技术领域, 加快模型的迭代速度, 推出具有声称输出速度是同类模型**4倍**的Gemini 3.5 Flash。可是, 这些调整引发了新的争议。直接把开发者从熟悉的IDE环境推往“Agent Manager”界面的Antigravity 2.0 , 弱化了传统的plan-review-implement协作流程, 致使用户信任度欠缺。更激进的是, 谷歌在没明确向用户提示的情形下, 强行把部分用户的Antigravity IDE界面升级成2.0的对话式提示框, 引发了开发者社区的强烈声讨。对比来看, 谷歌在AI编程赛道上正面临激烈竞争。依据Stack Overflow在2025年所做的调查, AI生成代码的平均漏洞率大约是45%, 有66%的开发者需要去处理“几乎正确”的AI输出。在竞品里, GitHub Copilot在启用的Python文件当中, 平均生成40%的代码。不过, 它所生成的代码引入的bug数量是纯人工代码的1.7倍, 安全漏洞比例也比纯人工代码高出15% - 18%。虽然GitHub Copilot于2026年的一项测评里头的综合评分是8.5/10, 在IDE集成度这边取得了9.6的高分, 然而它的Agent智能能力评分却仅仅只有7.5。这体现出了行业所面临的共同挑战便是: **怎样在提高代码生成数量的同时, 保证质量并且降低开发者用来验证的成本**。叹号左括号块视图斜杠markdown图像tos国别码i即信息技术即tt正斜杠386c87ee8f79434e8d44d36355d4d5e2右括号双井号, 未来之中, 信任呢比速度更具重要性, 能够预先看见, 谷歌凭借组织专责小组、整合产品入口、加速模型迭代这样的追赶策略呀是不会停下脚步的, 可是这场竞赛的关键所在, 早就不单单是模型基准测试的分数或者token输出速度了。怎样在不干扰开发者现有的工作流程以及不破坏其信任的状况下, 把AI能力毫无缝隙、稳稳当当地融入复杂软件工程的全程, 这会成为下一阶段竞争的关键之所在。行业整体正朝着更深层次的Agent协作模式发展, 然而这条路必定漫长。对于谷歌来讲, 它在模型能力方面的积累是优势, 可是要是没办法转化成能让工程师有省心之感, 而非产生糟心体验的产品体验, 那就很难获取决定性的开发者信任。两到三年之后, AI编程工具市场格局怎样演变咧, 关键就看谁能够更有成效地处理那个最为根本的矛盾, 啥矛盾, 就是AI快速产出代码的潜力, 跟人类工程师对于代码质量、可维护性以及业务逻辑正确性所抱有的绝对要求之间存在的落差。那场效率革命的上半段是生成代码, 下半段, 说不定将会是构建一套人机都能够高效协同的、全新的代码质量共识与信任体系。