一个人+AI,能跨更多环节
Web / Android / iOS / 后端 / 测试
跨端做出成果,再用专业判断把关
边界变宽,专业深度与设计品味仍然重要。
我现在招人,先看他能不能发现问题
谯洪敏 · DTalk联合创始人
前滴滴、得物资深技术总监 · 累计面试3000余人
人社部首批 AI 导师
多次参与北清复交校招 · 参与上百人的海外招聘
我是谯洪敏,前滴滴、得物资深技术总监,人社部首批 AI 导师。
大家好,我是谯洪敏。首页两个二维码,左边是本次演示和资料,右边是我的微信,欢迎会后交流。
我多次参与北清复交校招,也参与过上百人的海外招聘,累计面试3000余人。我现在招产品、研发和运营,越来越关心一件事:你能不能发现一个值得解决的问题?AI能帮我们写文档、写代码、做内容,但交出这些东西之后,用户的问题解决了吗?我希望看到的是,你把问题、目标和约束想清楚,和AI一起找办法,再用证据判断结果,发现偏差就纠正。今天我想结合自己的经历,讲三个变化:团队怎么干活,企业怎么招人,学校怎么培养能把事情做成的人。
机会不限于模型研发,销售、制造、财会、供应链也在出现AI技能溢价。
专业能力+AI协作,正在成为新的招聘信号。
这页将五个来源分别呈现:PwC看全球招聘广告增长与薪资,前程无忧看中国传统职能薪资差异,猎聘与智联看中国招聘薪资和核心岗位需求,LinkedIn补充整体招聘与新角色。条形图都从零开始;不同图各自标明指标与时期,不共享时间轴。
“要求会AI”和“未要求会AI”是职位广告要求,不是直接测量求职者会不会AI。PwC第11页方法为行业内分组比较,不足以证明同岗同级仅因AI能力产生工资差距。前程无忧是职能分组,完整方法仍未取得;猎聘也是两组广告均值。
不把2024报告的25%与2026报告的62%连成增长线:前者主要对应美国,后者是跨行业平均。LinkedIn的130万是职位发布计数,非净新增就业;其招聘率指标也不等于职位发布数,不能与PwC的增长相减。点击“读懂这页数据”可逐项查看原文与边界。
相关原文:PwC / PwC/Lightcast / 前程无忧/澎湃新闻转引(新浪转载) / 猎聘/北京日报转载澎湃报道 / 智联招聘/中国经济周刊转引 / LinkedIn Economic Graph / LinkedIn官方新闻室 / PwC
Web / Android / iOS / 后端 / 测试
跨端做出成果,再用专业判断把关
边界变宽,专业深度与设计品味仍然重要。
每天回家和AI聊,
把AI当作朋友。
从“查一个答案”
到连续追问、互动学习
这是一个孩子的习惯,不代表整代人的能力。
我带团队这些年,分工往往是Web、Android、iOS、后端和测试各管一段。现在,一个人结合AI可以跨更多环节;研发要懂产品,设计师也能直接做交互Demo。但跨端能跑,不等于每个环节都达到专业水平。审美、架构、性能与维护仍需要积累,AI让语法门槛降低,专业判断的价值更突出。
我儿子还是小学生,每天回家和AI对话,把它当朋友,新知识常常从聊天里接触到。这是我家的观察,不是说下一代天然更会提问、更懂AI。他们的使用起点和我们可能很不一样。我们不能只问用没用过工具,而要看他怎样追问、核查、解释自己的理解。这个问题同时留给面试官和老师。
主要通过少招新人调整;资深就业未见同样下降。
资深不等于“大牛”,也不意味着人人都受益。
U型是就业影响系数的形状,非年龄曲线;各档均为下降。
附录A.19 / 原图与分组方法 ↗过去,很多年轻人先拿到第一份工作,再慢慢积累交付经验。现在这条路正在发生变化。一项美国研究发现,采用AI的企业初级就业人数相对更少,主要通过少招新人调整。
但另一边,我身边确实有没读大学的年轻人,靠AI接单,做到年收入数十万,甚至上百万。这是我身边的真实案例,不代表普遍情况。
我想说的不是学历没用了,而是能力可以更早被看见:你做出了什么,谁愿意用,你能不能把结果讲清楚。对学校来说,要让学生在毕业以前,就经历真实任务、反馈和完整交付。
两张图为我提供的媒体截图,用来展示较早开始做作品的路径。截图中的年龄、收入、项目成果不能仅凭图片核实,不把收入数字作为本页已验证数据,也不把两个截图人物自动当成前述亲历案例。
本页分两层。第一层是初级与资深就业分化;第二层是初级员工内部,按院校声望五档分组。作者稿附录A.19显示,第3档降幅最大,第1与第5档降幅较小,2与4档也显著下降。这并不是两端就业上升,更不是低学历有优势。分档由GPT-4o-mini按声望生成,不是官方大学排名;第3档指较强的全国或区域院校,不能直接翻译成中国二本。该分析排除了最近学历为高中的岗位。少年截图是另一条路径的个案,不属于图中的一端。
口播:这不是简单地说年轻人赢了、中年人输了。企业压缩部分初级任务,资深岗位没有同样下降;初级员工内部,中间院校档位受影响更大。但作品又给一些年轻人开了新入口。所以我们要培养能解决问题的人,不能只靠一张学历标签判断未来。
专业基础继续考,AI协作过程必须看。
观察个人作答与专业基础
还需补充实际交付证据
为什么这样设计?
拆问题 → 给上下文 → 验证 → 迭代
追问:本人做了什么判断?
新条件来了怎么改?做坏了怎么恢复?
从“你知道什么”,进一步看到“你怎样把事做成”。
这页我想把新老面试放在一起看。过去我们让候选人手写算法、回答知识问题、在白板上讲架构。这些能考专业基础,也能考推理,不是只有记忆力。但如果面试只停在答题,我们还是不知道他在真实工作里怎样把事情做成。
所以我现在加一个动作:请打开电脑,投屏,和AI一起完成任务。我看你怎么拆问题、给上下文、验证结果、迭代纠错。以前追问“为什么这样设计”,现在还要追问“AI哪里可能错,你拿什么证明?新条件来了,哪些地方要改?做坏了怎么恢复?”
工具熟练度很快能看见,判断力要在错误和变化中验证。不能凭三十秒的熟练操作,或者一句对AI乐观还是悲观,就决定录用。专业基础仍然要考,投屏只看本次演练,不翻私人对话。
模糊需求:“做一个内部工具,让运营能批量给用户发优惠券。”
列出问题,确认规则
预览 → 提交 → 查状态
正常发放+中断重试
运行证据、剩余风险
只说“做幂等”不够:证明没有漏发、多发。
日期题能考边界,但听众先得理解续费规则。这次换成大家更容易理解的场景:给运营做一个批量发优惠券的工具。我故意只给一句需求,先不让候选人写代码,给五分钟说清楚自己要确认什么。
给哪些用户,发哪种券,有没有额度限制?谁能发?导入名单重复了怎么办?这些问题不是术语考试。关键是能不能把业务约束变成AI能执行的任务和验收条件。面试官在第五分钟统一给出规则,保证每个人有相同的实现条件。
然后十五分钟和AI做一个能跑的Demo,七分钟实际验证,最后三分钟讲结果。我追加一个场景:一百人里六十人已经收到券,任务中断了。运营点重试,你怎么办?只说“做幂等”不够,要实际展示哪些人成功、哪些失败、哪些结果还不知道,以及如何确认重试没有多发或者漏发。
我们提供起始项目和模拟发券服务,不要求半小时做完整生产系统。面试要看澄清、实现、验证的过程,不能只看页面漂亮不漂亮。这是一个观察能力的演练设计,还需要结合专业经验和其他面试证据。
完整题面、统一业务规则、工程追问与评分参考,请点击本页的“题面与评分参考”按钮。实施面试前,由面试方准备可运行的小项目与统一工具环境;本网页提供演练设计,不包含项目代码。
为什么选它?什么任务你会换一种办法?
Harness给模型配了什么?每轮上下文从哪里来?
哪一次你没有接受AI结果?依据是什么?
它能改哪里?做坏了怎么恢复?
你排除了哪些原因?下一步验证什么?
Loop凭什么继续、重试或停止?预算怎样控制?
最近哪次实践改变了你的AI用法?
讲清问题、拿出证据、说明纠正过程。
“我会用AI”太容易说了,我会继续问:为什么选这个工具?哪次你没有接受它的结果?出错以后,你怎么确认原因?
Replit公开过一次代理删除数据库数据的事件,代理还没有有效引导用户找到恢复路径。最后数据完整恢复了。所以我会问:你让AI干活时,它能改哪里,改坏了怎么恢复?
还有两个问题我很看重:继续试下去,还能得到什么新信息?最近哪次实践改变了你的用法?三轮还是十轮,不是评分标准。关键是你有没有获得新证据、缩小问题、调整方法。夸AI还是骂AI都不重要,判断的依据才重要。
工程岗位可以追问Harness、Loop engineering和上下文管理,但不是考名词。请候选人画出自己用的系统:模型收到什么、能调用什么、如何得到反馈、什么时候停止。工具使用者能解释操作与验证即可;平台或Agent岗位再深入状态、预算、恢复与评估。
相关原文:Replit
专业理解帮助你判断:什么值得做,什么算做好。
最后,把前面的面试观察收成三种能力。AI商,是能看出它哪里可能错,知道怎么验证;提问力,是把真正的问题、目标和约束说清楚;整合力,是把零散结果接成完整交付。
我们团队会让AI连真机跑端到端测试,做视觉比对,再交叉审查。但几个AI都说没问题,还不够,业务规则和真实运行结果要对得上。
这三种能力都需要专业基础。工具会不断变,行业经验也要更新。我要找的人,不只是会调工具,而是知道什么值得做、什么算做好,并且能和AI把它做成。
模型负责生成下一步;Harness把任务、工具、状态与检查组织成可运行的系统。
本轮必需:目标与约束+相关材料+最新反馈
检索、筛选、更新;原始记录存到外部,不把所有历史塞进提示词这张图是帮助面试沟通的简化模型,不是要求每个人手写一套平台。Harness是围绕模型的运行系统。Loop是其中反复决定、执行、观察的控制过程。上下文管理决定每一轮让模型看到哪些信息。
以发券为例:把活动规则和本轮状态给模型;工具先查询已经成功的名单,模型再决定下一步;遇到超时要看外部记录,不盲目重发。工具权限、失败恢复、预算和验收都要有人设计。Loop engineering指对这些反馈、重试与停止逻辑的设计,不是“让AI无限循环”,也不是必须新增一个职位。
画清楚最小循环、定义停止条件,起步门槛并不高;稳定支持生产环境还要考虑可观测性、权限、成本和恢复,不能承诺整体成本很低。面试按岗位深度追问,而不是背术语。
这页只展示讲者选用的原图。上一页讲清基本循环,这里让大家看更完整的组成,不逐项解释。图片通过原始链接加载,需要网络;点击可打开原图。相关概念延伸阅读见Sam Schillace文章,不能仅凭链接认定图片作者。
让AI操作手机、连接真机、核验画面
这几步还没有接成完整流程。
补齐操作与验证链路,
把手机回归测试场景跑起来。
先补领域知识,再把关方案;
让AI实现、跑测试,自己验收。
原样丢需求,生成什么贴什么;
代码越堆越乱,AI卡住,人也卡住。
我招的人:卡住时能找原因,做完后能拿证据。
先讲我的CTO朋友:手机回归测试自动化推进了半年,还没跑通,他觉得AI搞不定。我去看,让AI操作手机、连接真机、判断画面是否正确,这几步还没接起来。我们换了一套组合,把操作和验证接通,一周跑通了这个场景。卡住时,得先找原因,不能一句AI不行就结束。
再讲团队里的A和B,同一个模型,用法不一样。A接到陌生技术栈的需求,先和AI对话补领域知识,再审方案、做实现、跑测试、验收。原来估计两周的工作,三天交付,这是我们的经验估计。B直接把需求扔给AI,生成什么就贴什么,代码越堆越乱,AI答不出来,他也卡住了。
模型能力当然重要。招聘时我更要看这个人带来了什么判断:事情卡住,能不能找到原因;AI做完,能不能拿证据验收。光会夸AI,或者只会说AI不行,都不够。
两个故事均来自讲者亲历。三天与原估两周不是对照实验,不据此推算普遍五倍提效。微软审查案例与METR、Sonar数据分别保留在后续页面。
分段交接时,假设和接口偏差可能较晚暴露。
↶ 发现差异,回到共同Spec修正,再进入下一轮。
员工派发、监督、验收;负责人把子任务接成完整结果。
以前排好期,每个研发领一块回去做。现在先一起把业务问题、方案、接口和验收条件讨论清楚。产品带着Demo评审,设计从一开始参与体验;PRD说业务规则,TRD说技术约束,再共同审查开发计划。Demo代码适合就复用,不适合就重新工程化。
然后每个员工带着AI完成一个子任务:人派任务、人监督、人验收。这组人加AI就像大项目的一个sub-agent。负责人也结合AI持续整合,不能等所有人最后把结果堆过来。产品和设计看用户价值,研发看性能稳定性,运营看真实增量与成本。
我们一些同事的节奏是:白天理解业务、定义问题,下班前审好Spec,晚上让AI执行,次日上午Showcase验收。是惊喜还是惊吓?先纠偏,再定义下一轮。在线讨论也好,办公室结对也好,关键是共享目标和关键上下文;执行可异步,验收不能缺席。
图左是常见分段交接方式的简化,不是说过去所有团队都如此;成熟团队本来也会持续集成。图右把AI纳入执行,但重点仍是共同定义、共享接口、每个员工验收自己的子任务,以及负责人验证全局。人加AI可以类比项目中的工作单元,不意味着每个人必须搭一个软件sub-agent。在线共审关键决策,执行可以异步,不要求全天围着一个屏幕。
自报工作速度变为原来的
自报工作价值变为原来的
两项均由技术工作者自报,取中位数;不是员工与老板两组对比。
不是“效率提高80%”
不是“利润提高37%”
AI贡献至少5%的息税前利润
且自报AI价值显著
同等质量下,算清等待、审查、集成、返工与运行成本。
现在大家体感比去年快很多,这个变化应该承认。METR在2026年调查349名技术工作者,自报速度提升中位数是3倍,工作价值提升是1.4到2倍。注意,都是自报,也不是同一个指标。AI把一件以前不值得做的小事做快了,不等于业务价值也增长同样多。
麦肯锡2026年报告里,80%的受访者说个人提效,37%说AI对企业息税前利润有正贡献,6%符合研究的高绩效定义。样本有不同层级,不是1719名高管。三个数回答不同问题,不能说43%被返工吃掉,更不能说剩下的企业全都亏损。
我自己的例子是:写了一个多月,后来又删了约10万行。架构偏了、死代码多、规则打架,维护负担会在后面出现。这说明要测量,不能直接证明所有团队长期降效。2025年METR的反差实验和2026年的更新放到扩展资料,不再拿早期工具代表今天。
我会看同等质量下有多少需求真正被验收和采用,等待、审查、集成、返工和运行成本都算进去;两周后、一个月后还要回看质量。
口播:这里有两份不同调查。METR问同一批技术工作者,大家自估工作速度变成原来的3倍;换成工作价值来问,中位数是原来的1.4到2倍。这两个数都不是企业财务核算。麦肯锡则问有没有效果,80%的人说自己更高效,37%的人说AI对企业利润有正贡献。6%是跨过更高门槛的受访者:把至少5%的企业息税前利润归因于AI,而且认为价值显著。不要说效率提升80%、利润提升37%。
我的观点:做得快、做得值、企业赚到钱,是三个不同问题,要分别验证。
相关原文:METR / METR / METR / McKinsey/QuantumBlack
前一页是我删掉十万行代码的亲历。这张图用夸张的方式提醒我们:能把程序跑起来,信心会增长得很快,但理解不一定同步。它是示意图,不是实测曲线,也不是说所有Vibe Coding都会出事。
微软.NET的公开案例更具体:需求本身有问题,AI改了实现,也改了原有测试。资深工程师发现,旧测试记录的是有意保留的行为,于是关闭修改。这是审查成功拦截,不是线上事故。先确认验收标准,再谈测试通过。
Sonar调查里,53%提到代码看似正确却不可靠,40%提到多余重复代码,同时93%也报告至少一项正面作用。这些是多选感受,不能当缺陷率或相互加减。收益和维护负担可以同时出现,所以我们要求自查、小步集成、定期清理代码和规则。
案例来自微软.NET团队2026年3月23日的公开复盘,对应2025年10月11日的PR #120638。它展示的是工程审查成功拦截不合适的修改,不能写成AI蓄意篡改测试或已经造成线上事故;作者也肯定AI帮助调查的价值。
现场演练宜提供已准备好的可运行项目。评价澄清、修复、实测和复盘,不以脱稿流畅度或对话轮数代替判断。一次生成后充分验证可以得高分,反复对话却不核实也可能没有进展。测试通过之前,还要确认业务规则和验收标准本身是否正确。
Sonar《2026 State of Code》的调查实际在2025年10月完成,总样本1,149人,技术债多选题有效样本1,136人;53%和40%是选择相应问题的受访者比例,不是代码缺陷率。报告也有93%至少报告一项正面作用,不能单凭负面选项判断净技术债必然增加。DORA于2026年3月10日分析Google工程师2025年第三季度的1,110条开放回答,描述生成时间向验证和审查转移,并非所有人都降效。
生成者可以自查,重要交付还需实际执行、业务规则、反例与负责人审查等独立于生成结论的证据;换一个agent也可能共享错误假设。企业应并列观察周期、返工、故障、成本和业务结果,不能以代码行数、Token消耗或PR数量代替生产率。集中清理可以定期安排,关键问题应随任务处理。
相关原文:Microsoft/.NET团队 / dotnet/runtime / Sonar / DORA/Google
我招聘时,会把这五件事问清楚。
谁能批准交付?
出问题,谁组织处理?
谁承担成本与风险?
什么代价不能接受?
为什么值得做?
什么时候应该停止?
哪个更适合用户?
你用什么标准选择?
怎样说明承诺与边界?
靠什么兑现、修复关系?
让AI参与分析、生成和验证,让人承担取舍与承诺。
AI越来越能执行,也能参与推理和判断。人的价值不能简单建立在“AI永远不会某件事”上。我更愿意看五件事:责任、利害与取舍、目标、品味、信任。
AI可以建议目标、生成方案,也能帮助评估审美和验证结果。但在组织里,谁有权批准,谁承担成本,谁向客户作了承诺,必须说清楚。人也会误判,谨慎不天然等于正确;需要专业知识、反馈和实际证据来校准。
所以我问候选人的不是一句“你敢不敢签字”,而是:你依据什么接受这个结果,哪些情况不能签,出了问题准备怎样处理?AI可以参与判断,责任和承诺不能交给模型。
这是我给儿子写的乘法学习工具,截图就是本地真实运行的页面。这张完整截图中,上面点一下乘法表,看每次增加多少;下面把几组数量合起来,让加法与乘法、减法与除法联系起来。
我想让孩子不只记住3乘4等于12,还能解释它是什么,为什么换方向总数不变。展示动画只是第一步,接下来要让他自己说、自己做,再换题验证。这个工具是我的实践,并没有研究证明它已经提高了成绩。
老师可以用类似思路设计练习:将抽象难点变成可操作对象,提供反馈,再保留独立检验。全球正反案例和原文在扩展资料中。
最有说服力的对照:同一项数学随机实验,比较两种AI使用设计。
学生常请求并复制解答,
完成作业时可能跳过自己的推理。
主要提供提示,限制直接给答案,
帮助定位错误并继续尝试。
定制AI导师:所测单元学习增益更大。
短期随机实验,不代表长期、所有学科。
作业+18%,六个月内月考−20%。
30个月准实验追踪,非随机分配。
这次不只拿一个成功人物对比一组失败学生。我先讲同一项随机实验:土耳其高中数学,普通GPT组练习高48%,收起AI考试低17%;有教学约束的Tutor组练习高127%,但独立考试约和对照组相当。请注意,后者是避免了损害,不是证明考试能力额外提高。
为什么?论文中的交互记录显示普通组更常请求和复制完整解答,Tutor组更多寻求帮助、自己尝试。设计是否让学生经历思考很重要,但这不意味着只改一句提示词就保证所有学生都学好。
哈佛194人物理实验提供正面证据,中国26,811人的追踪提供风险证据。研究不止一篇,而且有原论文;不同情境不能直接比较大小,也不能把中国研究写成随机实验。
从真问题开始,向下补基础,再关掉提示独立做回来,这仍然是我的建议。Gabriel的经历保留在扩展资料:他在加入OpenAI前已有多年工程实践,不是只有学历标签或对话次数。
相关原文:PNAS / Bastani等 / Scientific Reports / Kestin等 / CEPR / Strömberg、Lei、Wu / Gabriel Petersson本人
在ICT学院、课程与竞赛基础上,真实项目能否更紧密地连接育人与用人?
华为与生态伙伴提供脱敏场景
附业务约束、测试环境和验收标准
企业工程师与教师共同带项目
学生用AI实现,解释关键取舍
演示结果、个人答辩、追加条件
同时评价可靠性与实际使用价值
经学生同意,将作品与评价用于
实习及岗位面试,入职反馈反哺课程
脱敏手册与工单,回答附依据;资料不足时说明不确定。验收看答案正确性、故障场景表现和用户反馈。
华为已经有ICT学院、课程和竞赛等人才培养基础。站在企业面试官角度,我想分享一点思考,和老师、企业同仁一起探讨:真实项目的评价与用人,是否可以连接得更紧密?
第一,华为与生态伙伴共同出题,带来脱敏后的真实场景、业务约束和验收标准。第二,让企业工程师和老师一起完成一次项目,再共同指导学生,老师也获得工程实践。第三,验收作品之外,还要看个人答辩、纠错记录,现场换个条件,看看学生是不是真的理解。第四,经学生同意,将这些项目证据用于实习和招聘,再把入职后的表现反馈给课程。评价标准可以共享,学生材料应有授权和范围控制。
比如试点一个设备故障知识助手,用脱敏手册和工单,要求回答有依据、资料不足时知道何时不能回答。让真实使用者反馈有没有帮助。除参与人数、证书和获奖情况,还可以观察独立解释与迁移表现、成果被采用的情况,以及实习后的岗位适应。这是我个人的思考,欢迎大家交流指正,不代表对华为现有体系的评价。
相关原文:华为官方
与AI共生,是持续学习,也是在行动中校准自己。
允许AI,追加条件,追问证据
共同定义,人带AI,验收结果
做出作品,独立解释,迁移应用
最后,我想讲的不是再背几个AI术语。时代已经在变,我们要主动改变自己:把AI用起来,把新的方法试起来,把不懂的地方学起来。
拥抱变化,不等于每一次输出都相信;保持判断,也不是停在一旁只挑毛病。我们和AI、和其他人一起工作:AI帮助扩大探索和执行的范围,人共同定义值得做的事情,用证据纠偏,承担对用户和社会的承诺。
过去人们也曾担忧小说、广播、电视和新媒介。这提醒我们不要只靠恐惧下判断,但不是说风险都不存在。好的回应是亲自参与、认真研究、调整设计。
面试官改一道考题,负责人改一次协作与验收,老师改一次作业。让AI扩大我们的能力,让学习与责任留在自己身上。我们要培养、也要成为的,是能发现问题、定义问题,和AI一起把事情做成的人。谢谢大家。