Agent 优先计算与初学者 CLI 素养的命运

一份基于研究证据的分析:初学者编程素养正在从命令生产,转向对智能体的委托、验证与恢复监督。

抽象的 Agent 优先计算工作流,包含终端、代码库、审批与审查节点

核心研判

根据现有证据,最站得住脚的结论是:对于许多初学者编程工作流而言,自然语言确实有望取代传统的初学者 CLI,成为其首要入口界面,但它并不能完全替代监督自主编码 Agent 所需的概念性知识。现代编码 Agent 已经允许用户用通俗语言描述意图,同时系统会探索代码库、编辑文件、运行本地工具、提出计划,并呈现审批、差异对比(diff)、测试和日志以供审查。OpenAI Codex CLI、GitHub Copilot CLI、GitHub Copilot 云端 Agent 以及 Claude Code 都明确支持这种“描述任务,然后监督 Agent”的模式。[1]

与此同时,文献并不支持更激进的说法,即初学者在进行自然语言交互且缺乏操作性理解的情况下,能够安全或持久地取得成功。针对初学者使用代码生成 AI 的研究反复呈现出一种复杂的局面:任务完成速度更快、挫败感更少,有时在近迁移任务上没有短期记忆受损,但同时也存在过度依赖、提示词遗漏、对生成代码理解薄弱、盲目自信以及带来新的验证负担等问题。这种模式意味着,稀缺技能正在从命令生成转向委托、验证和恢复。换句话说,关键素养正在从“我该如何输入命令?”转变为“我该如何告诉 Agent 要做什么、对其进行约束、检查其工作,并在其出错时及时纠正?”[2]

因此,一篇优秀的学术论文可以论证这样一个论点:真正的课程转型是从命令行素养走向 Agent 监督素养。该论点最严谨的表述应当是:初学者需要死记硬背的 Shell 语法远比旧课程所假设的要少,但他们仍然需要一个关于文件、进程、权限、版本控制、风险边界和故障恢复的紧凑心智模型,以便良好地监督自主 Agent。这一主张尚未在实验中得到完全证实,但编码 Agent 工具、初学者编程研究、人机委托研究以及 AI 安全研究的汇聚证据为其提供了强有力的支撑。[3]

为什么这个问题在当下至关重要

这一课题之所以重要,是因为界面层的变化速度远快于课程体系的更新。入门教材通常仍将终端视为一项必备前置技能,并在早期向初学者传授命令行导航、文件操作和 Shell 规范。MDN 的命令行课程将终端的使用定性为 Web 开发人员“毫无疑问”需要掌握的技能,并列出了诸如 cdlsmkdirgrepmvcp 等基础命令。The Odin Project 将命令行称为“关键技能”和“大本营”,而 Codecademy 和麻省理工学院(MIT)的《缺失的学期》(Missing Semester)也同样将熟练掌握 Shell 视为初学者的核心基础设施。[4]

然而,当下的工具已不再仅仅是自动补全。OpenAI 的 Codex CLI 表示,用户可以在代码库中直接开始,描述一项任务,然后让 Agent 探索代码、规划修改、编辑文件、运行工具,并在发布前审查更改。GitHub 现在将 Copilot CLI 描述为一个自主编码 Agent,能够规划多步骤工作流、运行测试,并在不同级别的人工审批下运行;而 Copilot 云端 Agent 则可以调研代码库、创建实现计划、在分支上修改代码,并在发起拉取请求(PR)之前进行迭代。Anthropic 则将 Claude Code 描述为一种 Agent 化编码工具,能够读取代码库、编辑文件、运行命令,并与终端、IDE、桌面和浏览器界面上的开发工具进行集成。[5]

这种结合导致了课程设置上的错配。传统的“Shell 优先”教学假设学习者从一开始就必须亲自编写并执行命令。而“Agent 优先”的工作流颠倒了这一顺序:学习者用自然语言陈述目标,Agent 提出或执行命令级的操作,而学习者的工作则变成了审批、审查、纠错和恢复。这一研究的意义不仅在于教学上的便利。它涉及一个更深层次的问题,即初学者的能力是否正在从语法熟练度转向监督性判断。关于 AI 编码助手的纵向文献已经描述了从创造向验证和“监督性工程工作”的更广泛工作转变,这表明这不仅是学生面临的问题,也是更广泛的软件实践中正在发生的新变化。[6]

证据如何看待初学者使用 AI 进行编程

关于性能提升的证据是真实存在的。在一项针对 69 名 10-17 岁初学者的对照研究中,使用 AI 代码生成器提高了代码编写任务的正确率并缩短了时间,而即时后测和一周后的记忆保留测试结果并未显示该工具有碍于学习所测任务。作者得出结论,在这些条件下,AI 编码助手可以为初学者的学习提供脚手架支持。另一项针对本科生在不熟悉的遗留代码库中进行棕地(brownfield)编程任务的对照研究发现,使用 Copilot 的学生完成任务的速度提高了 35%,解决方案进度提升了 50%,同时手动编写代码和在网上搜索的时间也更少。[7]

关于学习和判断风险的证据同样是真实存在的。Prather 及其同事对初学者使用生成式 AI 的实验室研究发现,尽管 21 名学生中有 20 人完成了分配的任务,但遇到困难的学子此前存在的元认知障碍依然存在,且生成式 AI 可能会加剧这些障碍,从而产生能力幻觉以及对其表现的虚假自信。对一门入门课程中 298 名学生的调查发现,ChatGPT 得到了广泛采用,但使用方式差异极大,从盲目接受生成的解决方案到更具批判性的参与不等,这促使作者呼吁建立课堂防线和明确的教学引导。另一项针对 231 名学生的研究发现,大多数人都在使用 AI 辅助编程任务,但报告的使用频率越高,与课程成绩的负相关性就越强,作者对此持谨慎解释态度,但将其视为教育上的一个警示信号。[8]

当任务本身变成自然语言编程时,证据尤为引人注目。作为生成式 AI 时代编程练习而引入的“提示词问题”(Prompt Problems),旨在教导学生通过构建自然语言提示词而不是直接编写代码来解决编程任务。一项针对 900 多名 CS1(计算机科学导论)学生的最新研究发现,这些任务通常被认为比传统编码任务更容易、更有趣,且能更好地针对问题解决,但学生最常犯的错误是遗漏关键细节,这表明他们过度依赖模型去推断自己未能明确说明的内容。当提示词失效时,学生往往倾向于澄清意图,而不是深入检查生成的代码或测试。[9]

更广泛的文献现在指向一个持久的模式:AI 可以减少生产任务中的摩擦,但同时使理解、校准和验证变得更加重要。最近一项关于生成式 AI 在编程教育中应用的系统性综述得出结论,成功的融合取决于有意的教学策略、结构化的评估和课程的一致性;它还警告说,过度依赖可能会削弱高阶思维和编程逻辑。一项 2026 年针对专业开发人员的纵向研究同样指出,AI 编码助手将精力从代码编写转向了验证和信任校准,创造了作者所称的“监督性工程工作”。[10]

这对你的研究问题的启示是微妙但重要的:初学者直接执行命令的技能需求可能比以前更少,但规范、判断和纠正中介行为的技能需求却更多。这也正是为什么这是一个严肃的研究课题,而非营销口号的原因。[11]

初学者仍需要哪些命令行知识

如果问题是“初学者在与自主编码 Agent 协作时,究竟需要多少命令行知识?”,那么最站得住脚的回答是:更少的语法,更多的系统理解。初学者在开始时可能不需要记住庞大的 Shell 词汇表,但确实需要一个足够健壮的紧凑操作模型来监督 Agent。

最低限度的实用知识似乎集中在少数几个概念上,而不是冗长的命令列表中:

  • 工作区与文件系统模型:什么是代码库、当前目录意味着什么、文件和文件夹如何关联,以及为什么在工作区之外进行编辑至关重要。Codex 的权限模型区分了工作目录内的操作与目录外的编辑,GitHub 的 Agent 文档同样区分了本地和基于分支的工作上下文。[12]
  • 执行生命周期:安装依赖、运行程序、执行测试以及解读日志或终端输出中的错误之间的区别。目前所有主流的 Agent 都明确将运行命令和测试作为其循环的一部分,因此用户至少必须识别出 Agent 处于哪个阶段。[13]
  • 权限与风险边界:何时允许 Agent 读取、编辑或使用网络;审批提示意味着什么;以及为什么自动审批会改变风险面。OpenAI、Anthropic 和 GitHub 都记录了审批或权限模式,GitHub 明确警告说 --allow-all-tools 会赋予 Copilot 运行用户可运行的任何 Shell 命令的权限。[14]
  • 变更检查与回滚:如何审查差异(diff)、保存工作检查点,以及撤销或隔离不想要的更改。Codex 强调审查和 Git 检查点;Copilot 云端 Agent 强调差异审查、基于分支的更改和拉取请求。[15]
  • 故障恢复:如何停止 Agent、重新运行测试、请求更安全的替代方案、重置范围,以及从糟糕的步骤中恢复。这一点正变得越来越核心,因为当前的 Agent 可以自主继续迭代,包括在减少中断的模式下,例如 Codex 自动审查(Auto-review)和 Claude Code 自动模式。[16]
  • 高风险操作识别:销毁文件、移出工作区、拉取任意网络内容、执行安装脚本或泄露密钥。在这些地方,提示词注入、数据泄露和工具滥用变成了实际的监督问题,而不再是抽象的安全话题。[17]

这就是为什么“自然语言取代 CLI”的说法过于粗糙。对于许多初学者来说,它可能会取代手动编写命令,但它并不能消除理解命令执行的语义后果的必要性。自然语言减轻了一项负担——无需记住精确的语法——但保留并在某些方面放大了理解哪些操作是安全的、哪些输出是可信的以及下一步应该发生什么的必要性。这一解释与早期的自然语言编程研究一致(该研究长期以来一直认为自然语言更接近问题领域,但也具有固有的模糊性),同时也与最新的终端用户编程研究相吻合(该研究认为生成式 AI 将注意力从学习正式语法转向了控制、代理、解释和调试)。[18]

此外,还有一个更深层次的人因工程学原因,让我们不能将自然语言的便利性等同于初学者的能力。人机委托研究表明,当人们缺乏关于自身能力以及 AI 优缺点的元知识时,往往是不合格的委托者,而上下文信息可以提高团队绩效。在编程教育中,最近一项 AIED 2026 的研究将“适度依赖”具体操作化为接受正确的 AI 建议并拒绝错误的建议;更高的信任度与更低的适度依赖相关,这意味着信任往往会降低辨别力,而不是提高判断力。这正是“Agent 优先”课程(Agent 优先计算与初学者 CLI 素养的命运)必须针对的失效模式。[19]

一个能够真正回答该问题的研究设计

一项强有力的研究应当对比你提出的三种教学模式:传统 CLI 优先仅 Agent 自然语言优先,以及融合最少 CLI 概念的混合 Agent 优先。混合模式尤为重要,因为现有文献很少将完全取消命令行素养与刻意压缩的系统模型进行对比;目前大多数研究比较的是“使用 AI”与“不使用 AI”,而不是相互竞争的课程顺序。[20]

实验结构

最干净的设计是对几乎没有或完全没有 Shell 经验的初学者进行随机对照试验。一个务实的受试群体可以是大学一年级新生、转行的成年人,或者是企业技能提升项目中的非技术专业人员。培训时长应当足够长,以避免得出玩具式的研究结果——比如持续数周,而不是单次实验——因为文献反复指出需要进行纵向研究,并警告不要对简短、狭窄的任务进行过度概括。[21]

任务库不应仅限于“编写一个小程序”。为了测试“Agent 优先计算”的真实主张,参与者应当完成真实的工作流,例如环境搭建、阅读不熟悉的代码库、实施针对性的修改、运行测试、调试故障、从错误的 Agent 操作中恢复,以及处理刻意设计的风险或特权请求。棕地任务尤为有价值,因为现有证据表明,AI 可以改变初学者在不熟悉的代码库中的表现,这比孤立的练习更接近真实的开发。[22]

关键的评估指标

评估指标集应当结合生产力学习效果安全性,而不是将研究仅仅简化为速度。

一个紧凑但强大的评估套件将包括:

  • 任务完成度与完成时间,因为对照研究已经显示出与 AI 相关的差异,且这些指标易于在组间进行比较。[7]
  • 适度依赖,在行为上通过在 Agent 中混入正确和错误的操作或建议来具体操作化,并测量参与者是否适当地接受或拒绝它们。这直接借鉴了最近一项教育研究的依赖框架,远优于简单的满意度或自我报告的信任度。[23]
  • 错误恢复质量,包括参与者是否注意到错误方向、控制损失并恢复到正确状态。这在逻辑上顺应了最新对监督工作和信任校准的强调。[24]
  • 安全与边界错误,例如不安全的审批、密钥滥用或未能识别不可信内容。由于提示词注入和工具滥用是 Agent 固有的风险,忽略这一维度将使研究不完整。[17]
  • 延迟记忆保留与迁移,包括数周后在有或没有 Agent 辅助的情况下执行相关任务的能力。这解决了短期脚手架效应与持久能力之间的差距。[25]
  • 概念性理解,通过解释性任务进行评估:Agent 做了什么、测试为什么失败、审批提示意味着什么,以及哪些文件或命令存在风险。这些解释型的评估至关重要,因为多项研究发现,尽管理解薄弱,但任务依然能够成功。[26]

值得检验的关键假设

一组合理的假设如下:

仅 Agent 组可能会在简单任务上取得最佳的早期任务完成率和最快的完成时间,因为现有的 AI 辅助研究往往在这些方面显示出最大的收益。[7]

传统 CLI 优先 组最终可能会表现出更强的手动独立性,但代价是短期准入门槛更高、初始摩擦更陡峭,以及在真实任务上的早期生产力较差。这是从当前课程设置以及许多初学者资源仍在高层自动化之前优先灌输 Shell 机制这一事实中得出的推论。[27]

混合 Agent 优先 组最有可能在综合目标上胜出:既有较高的早期生产力,又有较好的中期判断力、恢复能力和安全性。这一具体预期虽然是推论,但得到了多条证据链的支持:多层界面设计有助于初学者从简单开始,随后逐步增加复杂性;上下文信息可以改善委托决策;且编程教育综述越来越多地推荐有意的、结构化的生成式 AI 融合,而不是无限制的使用。[28]

为什么这一设计具有发表价值

这项研究之所以有价值,是因为它针对了文献尚未解决的空白。现有工作已经表明 AI 可以帮助初学者更快地执行任务,同时也记录了过度依赖、提示词遗漏、理解薄弱和盲目自信等危害。目前所缺失的是对相互竞争的教学顺序进行直接对比:应该先教授终端,还是应该通过 Agent 化工作流来解读终端?你的设计恰好能回答这个问题。[29]

课程与企业启示

如果研究结果正如现有证据所暗示的那样,其实际启示并不是“停止教授终端”。而是“停止将完整的终端语法作为第一道瓶颈来教授”。混合课程将把 Agent 视为学习者的初始控制界面,并逐步引入 CLI 概念,仅在监督、调试或恢复需要时才引入。这种结构与 Shneiderman 早期关于多层界面设计的论点高度契合:初学者从受限且更安全的图层开始,建立信心,随后仅在需要时才进入更复杂的特性。[30]

在教育中,这建议了如下顺序:从自然语言的目标规范开始;教授审批提示、差异对比(diff)和测试结果;引入文件系统 and 工作区模型;然后添加极少数用于检查和恢复的直接 Shell 操作。这一顺序也与最新的教育干预措施(如 Prompt Problems 和 CodeAid)相一致,两者都认识到教学目标不再仅仅是代码编写,还包括提示、反思和受保护的辅助形式。尤其是 CodeAid,在设计上明确设置了防线,以防止学生简单地索要直接解决方案,而是使用脚手架功能来支持理解和调试。[31]

在企业环境中,其相关性同样强劲。如今的 Agent 化工具已经运行在审批模型、权限预设、基于分支的审查流以及日益自主的模式下。这意味着入职培训不能止步于“这就是工具”。员工需要养成程序性的习惯,以界定任务范围、仅批准与任务相符的内容、识别不可信内容何时可能操纵 Agent,并在接受之前审查差异和测试输出。厂商文档以及来自 OpenAI、GitHub、Anthropic、OWASP 和微软的安全指南都指向同一个方向:自主性提高了对边界意识和规范监督的重视程度。[32]

这就是为什么委托素养(delegation literacy)这一短语不仅仅是聪明的品牌包装。它准确地捕捉了新兴的技能组合:阐明意图、约束工作区、控制权限、检查差异、验证测试、校准信任,以及从不良操作中恢复。关于人机协作的文献表明,委托质量取决于上下文理解、校准后的信任以及对人类判断的支持,而不仅仅是任务卸载。在编程中,最近关于“监督性工程工作”的研究表明,这些能力正在成为工作本身的一部分。[33]

拟定论文的底线结论

对于论文、课程或书中的章节来说,最具说服力的论点是:

自然语言现在已经足够强大,可以取代传统的初学者 CLI,成为许多学习者的第一个操作界面,但它并没有消除初学者对环境进行足够理解以监督自主编码 Agent 的必要性。 消失的并不是对操作性知识的需求;改变的是这种知识的形式。初学者的负担从记忆命令转向了受约束的委托、验证和恢复。[34]

这使得你拟定的标题——从命令行素养走向 Agent 监督素养(From Command-Line Literacy to Agent-Supervision Literacy)——具有实质性的力量,而不仅仅是修辞上的吸引力。它契合当前的工具格局,符合最优秀的初学者编程研究所发现的规律,并开启了一个具有明确课程和企业影响、可发表的实证问题。这一主张并不是说 CLI 已经消亡。而是主张,对于与自主 Agent 协作的初学者而言,CLI 不再是他们必须生成的主要内容;它日益成为他们必须学会解释和治理的环境[35]

参考文献

References

[1] [3] [12] [14] [32] Agent 审批与安全 | ChatGPT Learn

https://developers.openai.com/codex/agent-approvals-security

[2] [7] [20] [25] [29] 研究 AI 代码生成器对支持入门编程中初学者学习的效果

https://arxiv.org/pdf/2302.07427

[4] [27] 命令行速成课程 - 学习 Web 开发 | MDN

https://developer.mozilla.org/en-US/docs/Learn_web_development/Getting_started/Environment_setup/Command_line

[5] [15] [35] Codex CLI | ChatGPT Learn

https://help.openai.com/en/articles/11096431-openai-codex-limits

[6] [24] AI 编码助手对软件工程的影响:一项纵向研究

https://arxiv.org/html/2605.23135v1

[8] 不断扩大的差距:生成式 AI 对初学者程序员的利与弊

https://juholeinonen.com/assets/pdf/prather2024widening.pdf

[9] [31] 生成式 AI 时代的新编程练习

https://dl.acm.org/doi/10.1145/3626252.3630909?utm_source=chatgpt.com

[10] 编程教育中融合生成式 AI 的文献综述 | 国际人工智能教育学报 | Springer Nature Link

https://link.springer.com/article/10.1007/s40593-025-00524-3

[11] 理解学生在解决自然语言编程任务时的认知、错误和调试方法

https://arxiv.org/html/2607.05034v1

[13] [34] Codex CLI | ChatGPT Learn

https://developers.openai.com/codex/cli

[16] 无需同步人工监督的 Agent 操作自动审查

https://alignment.openai.com/auto-review/

[17] 理解提示词注入:前沿安全挑战 | OpenAI

https://openai.com/index/prompt-injections/

[18] faculty.ist.psu.edu

https://faculty.ist.psu.edu/wu/papers/n2p.pdf

[19] 人机协作中的认知挑战:探索高效委托之路 | 信息系统研究

https://pubsonline.informs.org/doi/10.1287/isre.2021.1079

[21] 集成开发中的人机体验...

https://arxiv.org/html/2503.06195v1?utm_source=chatgpt.com

[22] [26] GitHub Copilot 对计算机专业学生在棕地编程任务中编程效果、效率和流程的影响

https://arxiv.org/html/2506.10051v1

[23] 教育中对 AI 的信任与依赖:AI 素养与认知需求作为调节变量

https://arxiv.org/html/2604.01114v2

[28] [30] %!PS-Adobe-3.0

https://www.cs.umd.edu/users/ben/ACM-CUU2003.pdf

[33] 人机协作中的人类委托行为:上下文信息的影响

https://arxiv.org/html/2401.04729v2


相关阅读:Top AI Coding Assistants: 2026 Update to the 2025 Agentic Coding Guide

英文原文: Agent-First Computing and the Fate of Beginner CLI Literacy