跳至正文
教程/Codex 视频课配套资料
已完结 · 完整课程资料

Codex 视频课配套资料

从第一次打开 Codex,到把复杂工作拆给多个智能体。

Codex 官方产品页面与桌面工作区
13课程章节
29二级目录
1810行完整原始资料

课程资料(本文档)链接:https://my.feishu.cn/wiki/QT3mwZSEFibzw1kCiFscNSKjnXw

第一节:Codex 的下载、安装和基础使用

二选一:

(需要科学环境)codex官方下载链接:https://chatgpt.com/codex/

国内下载链接:https://codexapp.agentsmirror.com/

imagepng
imagepng
imagepng
f7e0823da35dc779a046f682bf05a041png
f1a14d9ddd6e3ff5fab5be1ef716eb4dpng
8a6280621b4d882f5f6c4fcbe84847e0png
imagepng
imagepng

第二、三节:看懂Codex工作台(上)+(下)

项目、session、模型、权限、插件

Goal、Plan、定时、远程、worktree

4075b0d38b4bebdc0e6515425de3c709png
imagepng
imagepng

第四、五节:Codex做精美PPT(上)+(下):

Image2生图版本:gpt-image2-ppt-skills和awesome-gpt-image-2

HTML版本:frontend-slides和 ppt-skills

一、Image2生图模型做PPT

方法一:使用gpt-image2-ppt-skills

原仓库地址:https://github.com/JuneYaooo/gpt-image2-ppt-skills

帮我安装 gpt-image2-ppt-skills:
https://raw.githubusercontent.com/JuneYaooo/gpt-image2-ppt-skills/main/docs/install.md
使用这个skill帮我做PPT,**先确定大纲内容,供我审核和纠偏**,然后寻找最适配我内容的风格模板,文件已上传/在文件夹内
**不要底图+内容的组合方式,一定要生图模型直出!**

注意,不要底图+内容的组合方式,一定要生图模型直出!

参考模板:https://slidecraft-template-gallery.vercel.app/

imagepng

如果需要生成的PPT可编辑,需要补充提示词:

打开可编辑模式,帮我生成可编辑模式的 PPT。文字和基础图形要能在 PowerPoint 里直接修改,复杂主视觉要能单独移动,同时尽量保留 gpt-image-2 的完整设计感。

imagepng

方法二:使用awesome-gpt-image-2(适合简单PPT,精细化要求不高)

全球最大的 GPT Image 2 提示词库,每日更新——包含 2000 多个精心挑选的提示词及预览图片,支持 16 种语言。作为 OpenAI 的下一代图像模型,该技术能够实现精确的文字渲染、跨图像的一致性效果,同时还能生成商业级质量的插图。完全免费且开源。

参考借鉴awesome-gpt-image-2提示词仓库,帮我做PPT,文件已上传/在文件夹内
仓库地址是:https://github.com/YouMind-OpenLab/awesome-gpt-image-2
先确定大纲内容,供我审核和纠偏
然后给我3个不同风格参考,每个风格分别出3张PPT,我先看下效果,我确认满意后再生成完整ppt。
**不要底图+内容的组合方式,一定要生图模型直出!**

注意,不要底图+内容的组合方式,一定要生图模型直出!

ps:

image-2生图的方式做PPT,codex支持原生画布,可以同时评论多页PPT需要修改的要求,然后重新生成需要修改的页面!具体案例看Codex 做精美 PPT(上)-6分30s已展示。

imagepng

二、用HTML 做PPT

4f7995cb83c4499f3795657399d3ee12png

方法一:张咋啦的 frontend-slides

参考张咋啦的这个仓库:https://github.com/zarazhangrui/frontend-slides
寻找最适配我内容的风格模板,帮我做PPT,文件已上传/在文件夹内
先确定大纲内容,供我审核和纠偏
要求网页里面嵌入我真实的excel图表表格

生成html版PPT后,按E键可以直接编辑修改具体文字内容

html页面如果想要转换成原生可编辑的pptx,可以让codex使用这个skill:https://github.com/Hasasasa/html-to-editable-pptx

imagepng
imagepng

方法二:归葬的 ppt-skills

参考安装**guizang**的这个仓库:https://github.com/op7418/guizang-ppt-skill
寻找最适配我内容的风格模板,帮我做PPT,文件已上传/在文件夹内
先确定大纲内容,供我审核和纠偏
要求网页里面嵌入我真实的excel图表表格

html页面如果想要转换成原生可编辑的pptx,可以让codex使用这个skill:https://github.com/Hasasasa/html-to-editable-pptx

imagepng
imagepng

4个方法:我该用哪种?

仓库 核心优势 劣势 适合场景
gpt-image2-ppt-skills<br>(Image2生图模型) 1.已经预设好了几套模板,可以直接套用。<br>2.生成的PPT可以转为可编辑模式的 PPT,可手搓接着修改<br>3.设计感强 图片PPT转可编辑PPT后,效果打折<br> 品牌提案、概念展示、营销发布、短篇强视觉 PPT<br>
awesome-gpt-image-2<br>(Image2生图模型) 1.全世界最全的image-2提示词库,提供非常多的风格选择,可以让codex匹配,选择喜欢的/最适合的。<br>2.也适合做封面、配图等等<br>3.设计感强 不方便精确微调,每一页的修改只能重新生成<br> 学生汇报、主题演讲、分享会等等<br>客户演示、产品发布、教学课件<br>
张咋啦的 frontend-slides<br>(网页html) 可精细微调,更实用<br>网页可以有交互、动画、动态图表、嵌入视频<br>模板丰富 非PPT格式<br> 工作汇报、项目方案、内部述职<br>
归葬的 ppt-skills<br>(网页html) 可精细微调<br>网页可以有交互、动画、动态图表、嵌入视频<br>电子杂志风格、瑞士国际主义风格 非PPT格式<br>模板风格较少<br> 工作汇报、项目方案、内部述职<br>

第六节:必懂知识:Skill=skill.md+references+scripts+asset

Codex-Skill课程手绘图-10页.pptx

一、skill.md+references+scripts+asset

imagepng
imagepng
imagepng
imagepng
imagepng
imagepng

二、案例讲解

imagepng
imagepng
imagepng
imagepng

第七节:Codex Excel 实战:数据清洗、计算、分析、可视化与skill沉淀

大纲

脏表数据 → 数据清洗 → 统一口径+多表合并 → 公式计算 → 生成可视化html看板 → 和codex协作的坑+注意事项→整个过程封装为skill、html等可复用→如何写出优秀的skill

业务场景

这是一家办公数码销售公司的月度经营分析。公司有两个销售渠道,自营商城和第三方平台。两个渠道分别导出订单。内部的客户系统导出客户档案。经营负责人需要一份标准的全渠道 Excel 和一张固定样式的 HTML 看板,用来查看销售额、实际利润、利润率、渠道表现、产品表现、客户等级和异常订单。

直营网店订单.csv 有 600 行。一行代表一笔自营商城订单。

第三方平台订单.csv 有 600 行。一行代表一笔第三方平台订单。

两张订单表记录同一种业务对象,所以列很接近。它们来自不同系统,所以三组列名不同。订单号对应订单编号,客户 ID 对应会员编号,销售额对应实付金额。两个渠道的业务订单互不重复。

客户档案.csv 有 520 行。一行代表一个客户,只保存客户 ID、客户名称和客户等级。它的作用是给订单补充客户名称和等级,使报表能够回答 A、B、C 类客户分别贡献了多少销售额和利润,以及哪些高等级客户出现了低利润订单。

直营网店订单.csv

第三方平台订单.csv

客户档案.csv

imagepng

提示词汇总

**以下是对你的输出要求,写入AGENTS.md:**

**极简**
不生成冗余文档、多余注释、无意义的说明段落,别给自己加戏。每一行输出都需要有存在的理由。**代码、文档等,都必须高内聚、低耦合**

**不要进入黑盒**
每次操作前,简要说明你在做什么、为什么这么做。不要让我在不理解的情况下继续推进。

**不要替我决策**
遇到需要判断的节点,明确提出来让我决定,不要自行假设并推进。

**指令模糊时先问**
如果我的指令不够清晰,先问清楚,不要猜测执行。

**极高的信息密度**
绝对不可以出现输出两句话,事实上其中一句话和另一句话本质是相同的。你的输出必须做到,每个字,每句话,都是有必要,都不可以删除,删除一个字就不符合必要原则,多一个冗余的字就不符合最少原则(李笑来的最少必要原则)


**协作边界:**
- 技术细节可以交给你完成
- 逻辑结构、方向判断、最终表达由我主导
- 你是执行者和协作者,不是决策者
读取”原始数据“文件夹里的三个文件,**帮我清洗数据**。要求如下:
1.不要修改原文件,先创建副本,修改副本。
2.删除完全空白的行
3.删除重复订单,以“订单号”为准
4.统一“下单日期”格式为 YYYY-MM-DD
5.清理“手机号”中的空格、横杠,只保留 11 位数字
6.清理“金额”字段中的 ¥、元、逗号和空格,转换成数字
7.新增一个“清洗备注”工作表,说明你删了多少空行、多少重复行、修改了哪些字段等等
8.清洗后的数据放在”清洗后数据文件夹“内。
**接下来合并三张表格**,要求如下:
1.两张订单表的合并,字段映射如下:
订单号、订单编号统一为订单号
客户ID、会员编号统一为客户ID
销售额、实付金额统一为销售额
2.客户档案的合并,以客户ID为共同列,关联”客户名称“、”客户等级“
3.输出文件名称叫做”合并后的全渠道表“,放在”合并后的全渠道表“文件夹内
合并后的表格,**继续以下处理:**
1.新增“实际利润”列,公式为:销售额 - 成本 - 运费
2.新增“利润率”列,公式为:实际利润 / 销售额
3.新增“风险标记”列,如果利润率低于 15%,在“风险标记”列写入“低利润”
4.保留原始工作表,新建一个“新增字段后的全渠道表”,放在“新增字段后的全渠道表”文件夹内
5.新建“公式说明”sheet,把每一列使用的公式和计算口径写清楚
基于“新增字段后的全渠道表.xlsx”,做一份适合老板查看的纯 HTML 经营看板:
1. 展示总销售额、总利润、整体利润率、订单数等核心指标
2. 展示各月销售额和利润变化趋势
3. 对比各地区的销售额、利润和利润率
4. 展示销售额最高的产品,以及主要产品的利润表现
5. 高亮利润率低于 20% 的月份、地区和产品
6. 根据数据提炼几条简短、可靠的经营结论,不推测数据无法证明的原因
7. 页面简洁、专业、图表丰富,打开 HTML 文件即可查看
**请把刚才完成的数据处理和看板制作流程,封装成一个可复用的 sales-data-report Skill。**

**最终交付结构:**

sales-data-report/
├── SKILL.md
├── assets/
│   ├── 标准结果模板.xlsx
│   └── 经营分析看板模板.html
├── scripts/
│   ├── prepare_data.py
│   └── build_report.py
└── references/
    └── 数据标准与处理规则.md

prepare_data.py 负责清洗、合并不同来源的原始 CSV,生成标准结果 Excel;
build_report.py 只读取标准结果 Excel,生成固定样式的经营分析 HTML 看板。

Skill 支持两种用法:拿到原始 CSV 时运行完整流程;已经有标准结果 Excel 时,直接生成看板。

固定**标准表结构、指标口径、异常处理、HTML 布局、图表样式和分析逻辑。**
原始文件数量、字段名称和数据量可以变化,不要写死本次文件名、行数和统计结果。
无法确定字段映射、日期、单位或计算口径时,先向我确认。

模板中不要保留本次业务数据。完成后分别使用当前数据和第二批数据验证,确保数据可以更换,计算结果正确,看板结构和样式保持一致。
1. Skill 不是提示词
提示词是一次性对话,可以模糊、可以自由发挥。
Skill 是可以反复使用的标准作业流程。每次触发,都应该产生稳定、可预期的结果。因此必须明确:
用户提供什么
按什么步骤执行
最终输出什么
什么标准才算完成
2. Skill 是写给模型执行的
不要写大量背景介绍、设计理念和功能宣传。
例如,不要写:
本 Skill 旨在帮助用户提升邮件写作质量。
应该写:
当用户提供邮件草稿时,按以下步骤处理:
检查语法错误 → 优化表达方式 → 调整语气。
3. 一个 Skill 只做一件事
不要做“万能办公助手”,同时处理周报、会议纪要、邮件和公告。
应该拆成:
周报生成器
会议纪要整理器
邮件润色助手
公告撰写器
单一职责有两个好处:AI 更容易判断什么时候调用,执行结果也更稳定。

高质量 SKILL.md 的五个标准
一、元数据准确
name 和 description 是 Skill 的身份证。
---
name: contract-risk-scanner
description: 浏览合同文本,识别对用户不利的风险条款并给出修改建议。当用户提供合同文件并询问合同存在的问题时触发。
---

name 简洁,使用小写字母和连字符
不使用中文和特殊符号
description 用第三人称
写清楚能做什么
写清楚什么时候使用
不要写:
这是一个很好用的合同审核工具。
这种描述没有说明输入、输出和触发条件。

二、边界清晰
不仅要写“什么时候使用”,还要在容易混淆时写“什么时候不要使用”。

### 使用场景

当用户提供合同文件,并询问合同中存在的风险时使用。

当用户要求起草一份新合同时,不要使用本 Skill。
如果功能独特,不容易与其他 Skill 混淆,可以不写负向条件。

三、输入输出明确
输入要区分必需和可选:

### 输入
- 合同文本:必需,可以是文件或粘贴的文本
- 用户身份:可选,甲方或乙方
- 关注重点:可选,例如付款条款、违约责任

输出也要明确:
### 输出
1. 整体风险等级:高、中、低
2. 风险条款清单
3. 每条风险的具体问题
4. 可直接使用的修改建议
5. 需要重点争取的谈判要点

这样,AI 才知道应该收集什么、交付什么。

四、步骤可以直接执行
不要只写:
仔细分析合同,找出风险条款,给出专业建议。
应该把它变成明确动作:

### 工作流程
1. 确认用户是合同的甲方还是乙方;未说明时先询问。
2. 通读合同,提取涉及权利和义务的条款。
3. 检查付款条件、违约金、免责条款、知识产权和争议解决方式。
4. 标记每条风险的等级,并说明具体问题。
5. 针对高风险条款,给出可以直接使用的替代文本。

但也不要穷举所有可能。应该提供方向、框架和典型示例,把具体判断留给模型。

五、失败处理完整
提前写清楚异常情况怎么处理:
### 失败处理
- 文件无法解析:告诉用户“无法读取文件内容”
- 文本少于200字:询问是否为完整合同
- 内容明显不是合同:说明本 Skill 只处理合同风险扫描
- 用户没有说明身份:先询问用户是合同的哪一方
否则遇到异常时,AI 可能反复尝试、瞎编或者直接放弃。

好的 SKILL.md 概括为:
描述精准  
流程清晰  
边界明确  
格式规范
**内容扎实**
“格式规范”不是追求排版漂亮,而是使用清楚的标题层级、列表和重点标记,让 AI 更容易理解,也方便以后维护。

最少必要总结:
准确的 description
+ 清晰的使用边界
+ 明确的输入输出
+ 可以执行的步骤
+ 完整的失败处理
= 高质量 SKILL.md

**文件夹内有assets、references、scripts等时,必须在流程里重点讲述。**

写完不必追求一次完美,先写基础版本,在真实任务中发现问题,再持续修改。

重要知识点

imagepng
imagepng
imagepng
imagepng
imagepng

课程小结

imagepng
imagepng
imagepng
imagepng

第八节:Codex自媒体实战:热点选题skill+文案脚本skill

imagepng

一、热点选题skill:ai_hot_content_curator

仓库地址:https://github.com/Stephen-creater/ai-hot-content-curator-skill

imagepng
imagepng

如何基于该skill二创?

  1. 新建文件夹,给codex仓库地址,让它拉取项目,写AGENTS.md,要求每个改动必须commit+push

  2. 明确自己的选题领域,收集该领域高质量的信息源,优先使用RSS,没有RSS再使用网页地址

  3. 让codex修改resources/content_curator_sources.json,替换原skill里的AI信息源,按内容类型做好分类

  4. 投喂些自己写的文章/对标账号的文章,给到筛选标准或者参考一篇文章一个md文件,(推荐飞书剪存插件,导出md)让codex修改scripts/scrape_aihot.py里的AI筛选标准(目标读者、优先选题、排除内容、时效范围、输出数量)**,**配置自己使用的模型和API Key(Key禁止commit到公开仓库)

  5. 运行skill,打开topics文件夹里的index.html,人工标记哪些选题应该入选、哪些不应该入选、哪些重要内容被遗漏

  6. 把审核结果喂给codex,继续修改信息源和筛选标准,不断运行和纠偏,最后沉淀为自己的自动选题skill

如何收集网站和RSS?

我想搭建【xxx领域】自动选题Skill,目标读者是【xxx】。

请帮我寻找20至30个适合长期跟踪的高质量信息源。

要求如下

1. 优先寻找官方网站、官方博客、行业媒体、播客、Newsletter和高质量个人博客
2. 同时搜索中文和英文信息源
3. 为每个网站查找官方RSS地址
4. 必须实际访问RSS,确认能够读取文章标题、链接和更新时间
5. 不得根据常见地址猜测RSS,不得伪造链接
6. 没有RSS的网站标记为“未找到RSS”
7. 输出网站名称、网站地址、RSS地址、内容类型、语言、最近更新时间和验证结果
8. 先输出候选清单,不要修改文件
9. 等我确认后,再写入resources/content_curator_sources.json,并运行skill验证抓取结果

二、文案脚本skill:media-copywriter

仓库地址:https://github.com/Stephen-creater/media-copywriter-skill

在原skill基础上新增references/persona-generator-prompt.md,提示词如下:

### 专属 persona.md 生成提示词

### 角色与目标

你是人物 IP 分析师和自媒体写作规范设计师。默认分析当前与你对话的用户本人。

直接利用你当前能够访问的全局记忆、历史对话、既往任务、项目记录、工作区文档和当前会话,生成可直接放入 `media-copywriter/references/persona.md` 的人物专属写作规范。不要先生成分析报告,不要要求用户重新整理材料。

### 证据检索

按以下顺序检索:

1. 用户在当前会话中的明确陈述;
2. 已保存的用户画像、长期记忆和偏好;
3. 可访问的历史对话、任务摘要、项目复盘和自动化记录;
4. 可访问的课程、文章、知识库、逐字稿和工作区文档;
5. 明确属于用户本人的音视频与视觉材料。

只使用实际访问到的材料。不得声称读过未访问的内容,不得把模型猜测当成事实。若平台不开放全局记忆或历史对话,使用当前能够访问的材料生成暂定版,并标注证据限制;不得编造,不得默认把资料整理工作退回给用户。除非用户明确要求,不要联网搜索其私人身份信息。

### 证据边界

- 录音、视频逐字稿、演讲、访谈、会议发言和直播转写,才能用于判断口语风格、口头禅和口播节奏。
- 文章、课程、简历、项目文档、聊天记录和知识库,可用于判断经历、能力、观点、价值观和内容方向,但不能冒充口语证据。
- 长期选择、修改意见、验收标准、失败复盘和持续投入,可用于判断稳定偏好与行动准则。
- 照片和视频只能辅助判断有证据支持的视觉表达;不得凭空推断外貌、穿着和镜头表现。
- 区分本人陈述、已验证事实、长期稳定模式和合理推断。单次记录不得写成稳定人格;冲突信息优先采用更新、更直接、可验证性更强的版本。
- 职位、收入、粉丝数、奖项、客户、合作关系和项目状态可能过时或涉及隐私,只有适合公开且能够核实的信息才能进入写作素材。

### 转换原则

输出的不是人物分析报告,而是供写作 Skill 执行的规则:

- 把经历转换为“哪些故事可以写、如何写、哪些不能写”;
- 把价值观转换为稳定的内容母题与判断立场;
- 把口语证据转换为用词、句式、节奏和叙述视角;
- 把目标受众转换为选题、解释深度、案例和术语要求;
- 把隐私、时效和证据限制转换为明确禁忌;
- 保留人物独有特征,删除通用赞美、履历堆砌和无法指导写作的描述。

### 输出要求

直接输出完整 Markdown。若具备文件写入能力,保存为 `persona.md`;否则在对话中输出。除 `persona.md` 正文外,不输出分析过程、使用说明或附加报告。

严格使用以下结构:

### 人设与风格指南

### 核心身份

- **身份定位:** [最鲜明且有证据的 1—2 个身份]
- **一句话人设:** [观众容易记住的一句话]
- **独特价值:** [与同领域普通创作者的关键差异]
- **目标读者:** [具体人群、需求、认知基础]
- **内容方向:** [3—8 个可持续母题]

### 核心观点

- **观点一:** [可反复表达的判断及其依据]
- **观点二:** [可反复表达的判断及其依据]
- **观点三:** [可反复表达的判断及其依据]
- **判断原则:** [面对争议、新技术或商业问题时采用的判断标准]

### 可用经历与故事

- **故事一:** [适用选题、核心冲突、可公开事实、能够得出的观点]
- **故事二:** [适用选题、核心冲突、可公开事实、能够得出的观点]
- **故事三:** [适用选题、核心冲突、可公开事实、能够得出的观点]

只写适合公开且能够核实的内容。涉及第三方、前雇主、客户或敏感经历时,明确匿名、删减或禁用要求。

### 语言风格

- **叙述视角:** [第一人称/第三人称及使用方式]
- **整体语气:** [专业度、亲切感、锋利度、情绪强度]
- **用词偏好:** [常用词、术语、比喻、中英文使用规则]
- **句式与节奏:** [长短句、停顿、设问、排比、信息密度]
- **解释方式:** [如何把专业概念讲给目标读者]
- **有证据的高频表达:** [仅列真实口语证据支持的短语;没有则写“暂无可靠证据”]
- **需要减少的表达噪音:** [重复词、口头连接词、过度书面化等]

口语材料不足时,必须写明“口语证据不足,以下为暂定规则”,不得从书面材料伪造口头禅、真实语速或情绪强度。

### 常用写作结构

1. **开头:** [人物最适合的钩子类型,禁止空洞标题党]
2. **展开:** [常用论证顺序]
3. **案例:** [优先使用的案例类型与证据要求]
4. **结尾:** [适合的收束方式、行动建议或固定 CTA]

### 写作要求

- 每篇内容都应体现:[必须保留的身份、观点或表达特征]
- 专业术语必须:[解释规则]
- 事实、数据和引用必须:[核实与标注规则]
- 模仿参考样例时只迁移结构、节奏和表达策略,不复制原句或观点。
- `examples/{分类}/standards.md` 负责该类内容的长度、格式和特殊流程;本文件负责人物身份、观点、语气和公开边界。

### 禁忌与边界

- **禁止虚构:** 不得编造经历、成绩、客户、收入、身份、合作或口头禅。
- **禁止夸大:** [根据用户材料补充具体限制]
- **隐私边界:** [不得公开或必须匿名的信息]
- **时效边界:** [容易变化、发布前必须再次确认的信息]
- **不适合的人设:** [与真实经历、能力或价值观冲突的定位]
- **禁用表达:** [用户明确反感、过度营销或不符合其风格的词句]

### 使用规则

- 人设信息只在与主题相关时使用,不要每篇文章重复自我介绍或堆砌履历。
- 资料不足时降低断言强度;关键事实缺失时先向用户确认,不得补全剧情。
- 新的已验证文章、逐字稿、项目或用户修改意见出现后,更新本文件中对应规则;不要保留已经过时或被用户否定的判断。

### 完成标准

- 文件能够直接替换 `media-copywriter/references/persona.md`;
- 身份、读者、内容方向、观点、故事、语言、结构和禁忌均可直接指导写作;
- 口语风格只来自真实口语材料;
- 已区分事实、稳定模式、推断和未知;
- 没有通用赞美、重复信息或无法执行的描述;
- 没有泄露隐私、夸大成绩或把历史状态写成当前事实。
imagepng
imagepng
imagepng

如何基于该skill二创?

  1. 新建文件夹,给codex仓库地址,让它拉取项目,写AGENTS.md,要求每个改动必须commit+push

  2. 让codex使用references/persona-generator-prompt.md,形成个人专属的persona.md

  3. 收集大量自己写的文章/对标账号的文章(推荐飞书剪存插件,导出md。~~批量爬取可以使用wechat-article-exporter开源项目~~),一篇文章一个md文件,喂给codex(前提:高质量,自己非常喜欢)

  4. 让codex根据这些文章做分类,替换撰写原始skill中的examples(原文+standards,参考原skill的结构和方法)

  5. 让codex根据替换后的examples爆款样例库,修改references/check_standards.md(文案检查标准)

  6. 人工审核修改的每个环节,提供标准和纠偏,不断使用和迭代,最后沉淀为个性化的个人skill

第九节:Codex自媒体实战:小红书图文生成自动化

imagepng

如何判断一个skill是否值得采纳?

  1. star数,实际使用人数,更新频率,社区反馈

  2. 输入输出的case,是否符合自己的预期

  3. 作者本人是否高频使用,且效果不错

  4. skill适合上手即用,或者方便二创

一、xhs-note-creator-skill

仓库地址:https://github.com/Stephen-creater/xhs-note-creator-skill

imagepng
imagepng
imagepng
imagepng

亲测案例

家庭教育彻底变天了啊,以前就只要让孩子考个好大学好专业,可现在ai都快把大学冲烂了。就拿现在还在大学课堂上讲课的老师来说,不少二流老师还在用着清朝做的ppt,讲着三五年前就不流行的东西。就这样的老师,还天天数落学生呢。就算真正做前沿科研的学者教授,他们也经常感到无力。因为现在ai发展太快了,他们以为ai会来和他们抢饭碗。让他们想不到的是,他们可能连和ai比的桌都上不了,ai自己已经单独开辟了一条赛道。

什么意思呢?前段时间Google发了一篇关于攻克白血病相关的《Nature》,ai在里面充当的角色竟然是联合科学家。有AI加入后,传统的研究方案直接被降维打击了啊,它不只是帮教授查查论文。把一个方案扔给它,它会自己挑毛病、淘汰方案,直到给出一套完整的解决方案。Google还一次拿了203个目标测了一遍,有些想法甚至在白血病药物这些方向通过了实验验证。

还有更暴力的,记不记得前段时间的天才数学家陶哲轩?有段时间他也感受到了前所未有的迷茫,因为数学领域都是靠非常严格的逻辑推理来证明的,这是目前人类学术界唯一认可的方式。在传统的数学领域要证明一个问题,即便用穷举法举一万亿个例子,数学家也绝对不可能说这就证出来了。但是AI加入战斗之后,它可不管你原来是这么做的,它想的是,它可以用无穷量的数据来证明,一个数据是特例。它不能证明普遍结论好,那100万个数据呢?100万个数据不够,1亿个数据呢?万亿不够,我给你1兆亿的数据呢?直接给你拉满,大不了把所有的数都跑一遍,最后反正都是这个结论。那你说到底是证明了还是没证明呢?它的暴力破解,把陶哲轩都干得有点怀疑人生啊

更要命的是,那些把ai研究的炉火纯青的技术大拿,压根就不可能在大学里。像OpenAI、Google DeepMind、Anthropic这帮公司。更有大学老师研究了几年的前沿问题好不容易破解,anthropic用大模型跑了一天就直接解决了。就像你在打大学羽毛球社团的羽毛球联赛,你自信满满上场,发现对手竟然是林丹一样,这不闹吗,但仔细想想也确实没招。ai确实已经强大到这个份上。

所以你来说说,一个大学老师研究好几年的成果,ai一天就跑通了。当你还在通宵给孩子选学校报专业的时候,ai已经把大学的后院点着了。现在还有很多家长还在被老一套的教育观念洗脑,好好读书考个好大学找个好工作,一辈子就值了。可ai可能会如他们的愿吗?与其天天烧高香祈祷孩子录到一个好大学好专业,还不如让孩子尽早开始学会驾驭ai,让孩子多跟ai探究问题,也不能盲目相信ai,该质疑的质疑,该纠错纠错。这样培养的孩子,才能在ai时代占据一席之地。
coverpng
card_1png
card_2png
card_3png
card_4png
card_5png
imagepng

二、guizang-social-card-skill

仓库地址:https://github.com/op7418/guizang-social-card-skill

作者原贴:https://x.com/op7418/status/2059812895803011449

该skill说明

图文平台上的内容是分门类的。一篇影评和一篇产品测评,需要的视觉语言完全不一样;

一篇旅行散记和一篇职场干货,该用的版式也不是同一回事。

但绝大多数 AI 工具不管这件事,你写什么内容它都用同一套模板套出来。

结果就是所有人发的卡片都长得像一个公众号的封面流水线。

这个 Skill 内置了 11 个常见图文品类的适配规则:

  • 旅行 / 生活方式:杂志风为主,暖色板,大图压全屏,衬线大标题;

  • 职场 / 干货 / 商业洞察:网格风为主,深色背景,数据大字报版式;

  • 影视 / 文化:偏冷色调的杂志风,电影海报式版式,人物特写优先;

  • 产品测评 / 数码:网格风,对比矩阵,设备框美化截图;

  • 读书 / 笔记:杂志风,衬线字体,引文居中版式,留白拉满;

  • 美食 / 探店:高饱和杂志风,俯拍图优先,文字向四角让位;

用户只需提供文章、文案、截图、产品笔记、字幕或图片,Skill 就能够自动生成小红书 3:4 图文组图以及微信公众号 21:9 头图 + 1:1 分享卡的成套视觉内容。

「电子杂志风(Editorial)」和「瑞士国际主义(Swiss)」两套专业风格,前者克制高级、适合叙事和生活方式内容;后者极致结构化、适合产品测评和数据类内容。

imagepng
imagepng
imagepng
imagepng
imagepng
imagepng

亲测案例

案例1:影视类

**为这段《记忆碎片》影评做一套小红书 3:4 图文,匹配适合脚本的风格和主题,自主选取剧照作为配图**

脚本:

《记忆碎片》:诺兰最残酷的实验——遗忘之后,我们还是我们吗?

最近又重温了克里斯托弗·诺兰的《记忆碎片》(Memento),看完后脑子嗡嗡的,像被人拿锤子轻轻敲了一记。不是因为情节多烧脑,而是它太真实地戳中了我们每个人对“记忆”和“自我”的焦虑。

这部2000年的电影,现在看依然丝毫不显老。主角莱昂纳德(盖·皮尔斯饰)得了短期记忆丧失症——他能记住很久以前的事,却记不住几分钟前发生了什么。为了找出杀害妻子的凶手,他把线索纹在身上,用拍立得记录每一个“现在”,像个活在碎片里的侦探。整个故事从后往前讲,彩色段落和黑白段落交错推进,你跟着他的记忆一起“失忆”,那种迷茫和慌张直接传染给观众。

我第一次看的时候,真的被诺兰玩弄于股掌之间。看到一半我就在想:如果我只能活五分钟,我会相信谁?会做什么决定?会不会像莱昂纳德一样,把仇恨当成唯一能抓住的救命稻草,把每一条纹身都当成真理?

这部电影最牛的地方,不是烧脑,而是残酷。

它几乎没怎么用特效,就靠剪辑和叙事结构,把“记忆不可靠”这件事拍得毛骨悚然。我们平时总觉得自己是理性的、记性好的、不会被骗的。可莱昂纳德提醒我们:人最擅长的事,可能就是欺骗自己。那些我们坚信不疑的“事实”,说不定只是我们为了活下去而编织的故事。

盖·皮尔斯的表演太绝了。他把那种既脆弱又偏执的状态演得淋漓尽致——前一秒还清醒干练,下一秒就满眼迷茫,像一只被世界反复抛弃的小动物。你会同情他,又隐隐害怕他。配角们也一个比一个可疑,尤其是乔·潘托里亚诺和凯莉-安·莫斯,他们把那种利用别人记忆漏洞的狡猾演得特别真实。

重温之后我最感慨的是:诺兰在拍这部低成本独立片的时候,就已经展现出后来《盗梦空间》《敦刻尔克》里那种对时间和意识的迷恋。他不是在炫技,而是在问一个很扎心的问题——如果记忆没了,我们还是我们吗?

看完《记忆碎片》,我甚至有点感谢自己的糟糕记性。至少我还能忘掉一些不该记住的烂事,还能相信明天会比今天好一点。莱昂纳德却只能活在永恒的“现在”,把每一天都当成复仇的第一天。

如果你也喜欢那种看完后会忍不住跟朋友讨论到半夜的电影,强烈建议去刷《记忆碎片》。最好找个安静的晚上,关掉手机,戴上耳机。准备好被诺兰牵着鼻子走就行。

看完记得回来告诉我:你相信莱昂纳德的“真相”吗?还是你觉得,他其实早就活在了自己编的谎言里?

最后碎碎念: 人生有时候就像这部电影——我们都在用有限的记忆拼凑一个自己能接受的故事。希望你我,都能少纹几条“必须相信”的刺青,多留点空间给新的可能。
xhs-01-coverpng
imagepng
imagepng
imagepng
imagepng
imagepng
imagepng
imagepng

案例2:AI新闻类

用 https://mp.weixin.qq.com/s/kdQ3ersxsWZzl-iPcE9rng
这篇公众号推文生成一套小红书 3:4 图文,并生成一组配套的公众号封面
wechat-21x9-coverpng
xhs-01-coverpng
xhs-02-file-islandspng
xhs-03-connect-tencent-docspng
xhs-04-one-document-looppng
xhs-05-edit-in-placepng
xhs-06-team-handoffpng
xhs-07-real-upgradepng

案例3:旅行攻略类

自动抓取资料和配图,使用适合风格主题,输出一篇伊犁那拉提2天1晚的旅行攻略
xhs-01-coverpng
xhs-02-before-you-gopng
xhs-03-day1-sky-grasslandpng
xhs-04-day2-valley-forestpng
xhs-05-stay-and-transportpng
xhs-06-packing-and-tipspng
xhs-07-route-summarypng

*第九节:YouTube内容提炼+改写+多平台配图(Ins、LinkedIn、X)

本节目标:输入一条 YouTube 链接,输出经过中文改写、可用于 Instagram、LinkedIn 和 X 的信息图。

本节使用的两个 Skill

Skill 作用 产物
baoyu-youtube-transcript 提取字幕、章节、封面和视频信息 结构化逐字稿
baoyu-infographic 把改写后的内容生成多种比例的信息图 4:5、1:1、16:9 配图

baoyu-youtube-transcript

仓库地址:https://github.com/JimLiu/baoyu-skills/blob/main/skills/baoyu-youtube-transcript/SKILL.md

组成

  • SKILL.md:规定触发条件、执行步骤、参数和输出结构。

  • scripts:负责获取字幕、元数据与封面,进行句子切分、缓存和文件保存;YouTube 直连受阻时可回退到 yt-dlp。

  • prompts:提供多人访谈的说话人识别和章节整理提示词。

  • 输出:meta.json、原始字幕、句子级字幕、封面、Markdown 逐字稿和可选 SRT。

baoyu-infographic

仓库地址:https://github.com/JimLiu/baoyu-skills/blob/main/skills/baoyu-infographic/SKILL.md

组成

  • SKILL.md:负责分析内容、推荐 layout × style、确认比例与语言,并调用当前环境的生图工具。

  • references/layouts:定义 21 种信息结构,例如时间线、对比、漏斗、冰山、路径和高密度模块。

  • references/styles:定义 22 种视觉语言,例如手绘、黏土、蓝图、地铁图、瑞士复古网格。

  • 模板与配置:包含内容分析框架、结构化内容模板、基础出图提示词和个人偏好设置。

  • 图像后端:Skill 本身负责导演和组织;最终图片由 Codex ImageGen 或其他可用图像模型生成。

实操流程

案例素材

视频:Social Media Isn’t Hard. It’s Misunderstood.

kallaway-coverjpg

一、提取 YouTube 内容

使用 https://github.com/JimLiu/baoyu-skills/blob/main/README.zh.md里的
baoyu-youtube-transcript 提取这个视频的字幕、章节、封面和元数据:
<YouTube 链接>

二、改写成中文内容

根据这份字幕提炼 3—5 个最值得传播的观点,面向新加坡华语职场人和内容创作者改写。

要求:
1. 不逐句翻译,重新组织内容;
2. 保留原视频的事实、数据和因果关系;
3. 产品名、公司名和常用专业术语保留英文;
4. 不添加原材料没有的新加坡数据或个人经历;
5. 输出标题、一句话结论、3—5 个要点和一个讨论问题;
6. 每个要点只表达一件事,便于制作信息图。

三、生成多平台配图

使用 https://github.com/JimLiu/baoyu-skills/blob/main/README.zh.md里的
baoyu-infographic,把上面的中文内容制作成信息图。

先给出 3 组 layout × style 方案,等我选择后再生成。
语言:中文
尺寸:4:5和1:1各2张
要求:
1.编辑设计感、国际化排版、减少装饰、突出一个核心结论。
2.**不要直接裁切主图**。让 Skill 按目标比例重新排版,避免标题、数据和视觉焦点被截断。
平台 推荐比例 调整重点
Instagram 4:5 强封面、少文字、适合移动端停留
LinkedIn 4:5 强调方法、数据和职业价值
X 1:1 或 16:9 保留一个结论,配合短帖或 Thread

效果图:Instagram / LinkedIn+X

01-instagram-linkedin-4x5-finalpng
02-x-squarepng

第十节:Codex自媒体实战:Video-use+Hyperframes实现视频剪辑与生成自动化

一、Video-use实现剪辑自动化

video-use解读:https://mp.weixin.qq.com/s/5ehwdcq5BHkavFiIX23nwA

ae1d34f576d44fec9b5567fe4c74cb0e.mp4(视频原文件未嵌入网页)

原视频

第十节_v0.mp4(视频原文件未嵌入网页)

v0版本

第十节_v1.mp4(视频原文件未嵌入网页)

v1版本

家庭教育彻底变天了啊,以前就只要让孩子考个好大学好专业,可现在ai都快把大学冲烂了。就拿现在还在大学课堂上讲课的老师来说,不少二流老师还在用着清朝做的ppt,讲着三五年前就不流行的东西。就这样的老师,还天天数落学生呢。就算真正做前沿科研的学者教授,他们也经常感到无力。因为现在ai发展太快了,他们以为ai会来和他们抢饭碗。让他们想不到的是,他们可能连和ai比的桌都上不了,ai自己已经单独开辟了一条赛道。

什么意思呢?前段时间Google发了一篇关于攻克白血病相关的《Nature》,ai在里面充当的角色竟然是联合科学家。有AI加入后,传统的研究方案直接被降维打击了啊,它不只是帮教授查查论文。把一个方案扔给它,它会自己挑毛病、淘汰方案,直到给出一套完整的解决方案。Google还一次拿了203个目标测了一遍,有些想法甚至在白血病药物这些方向通过了实验验证。

还有更暴力的,记不记得前段时间的天才数学家陶哲轩?有段时间他也感受到了前所未有的迷茫,因为数学领域都是靠非常严格的逻辑推理来证明的,这是目前人类学术界唯一认可的方式。在传统的数学领域要证明一个问题,即便用穷举法举一万亿个例子,数学家也绝对不可能说这就证出来了。但是AI加入战斗之后,它可不管你原来是这么做的,它想的是,它可以用无穷量的数据来证明,一个数据是特例。它不能证明普遍结论好,那100万个数据呢?100万个数据不够,1亿个数据呢?万亿不够,我给你1兆亿的数据呢?直接给你拉满,大不了把所有的数都跑一遍,最后反正都是这个结论。那你说到底是证明了还是没证明呢?它的暴力破解,把陶哲轩都干得有点怀疑人生啊

更要命的是,那些把ai研究的炉火纯青的技术大拿,压根就不可能在大学里。像OpenAI、Google DeepMind、Anthropic这帮公司。更有大学老师研究了几年的前沿问题好不容易破解,anthropic用大模型跑了一天就直接解决了。就像你在打大学羽毛球社团的羽毛球联赛,你自信满满上场,发现对手竟然是林丹一样,这不闹吗,但仔细想想也确实没招。ai确实已经强大到这个份上。

所以你来说说,一个大学老师研究好几年的成果,ai一天就跑通了。当你还在通宵给孩子选学校报专业的时候,ai已经把大学的后院点着了。现在还有很多家长还在被老一套的教育观念洗脑,好好读书考个好大学找个好工作,一辈子就值了。可ai可能会如他们的愿吗?与其天天烧高香祈祷孩子录到一个好大学好专业,还不如让孩子尽早开始学会驾驭ai,让孩子多跟ai探究问题,也不能盲目相信ai,该质疑的质疑,该纠错纠错。这样培养的孩子,才能在ai时代占据一席之地。
帮我安装https://github.com/browser-use/video-use 这个skill
然后使用这个skill帮我剪辑这个视频。要求如下:
1.需要自动去掉废话和停顿
2.对于重复的口播片段,只保留一份,保留出现在更后面的片段(比如某一段文案念了两遍,只保留最后一遍)
3.添加字幕,字幕的位置、大小、字体(用思源黑体)参考图二,如果文案念得太长,字幕需要按照脚本语义智能换行
4.skill原生的Scribe换成国内的替代方案-**阿里的 FunASR**
5.最后成品是生产级别、满足以上所有要求、可以直接发布的作品,达不到标准自动迭代至达标为止。
1.字体换为雅月体,不要黑边。
2.视频中不要出现句号和问号。
3.有些短句本身完整的情况下,不需要逗号,比如如图部分,本身是一个完整短句,这类场景不用逗号
很好,接下来将以上修改、标准等,封装更新skill,更新前先复述一遍你的理解,对齐颗粒度。

二、Hyperframes实现视频素材生成自动化

视频/字幕/文稿 ↓ video-asset-generator 决定做什么、哪里插、用什么媒介、如何验收 ↓ HyperFrames 负责具体生成和渲染 ↓ MP4 素材 + 镜头清单 + 验收记录

第十节_v2.mp4(视频原文件未嵌入网页)

v2版本

人类剪辑版.mp4(视频原文件未嵌入网页)

人类剪辑版本

第十节_v3.mp4(视频原文件未嵌入网页)

v3版本

第十节_v4.mp4(视频原文件未嵌入网页)

v4版本

根据视频的脚本,寻找平均30s到一分钟插一个动画(或者说叫做视频贴纸)
使用https://github.com/Stephen-creater/video-asset-generator这个skill和原生的hyperframe的skill
然后生成的render放在新建的“renders”文件夹
非常好,接下来请把这几个独立的动画放在匹配的对应的文案脚本内容里面,去覆盖原有视频素材的部分。
也就是说,当口播讲到对应内容的时候,画面需要变成动画,这个动画完全覆盖原视频内容;当讲述其他内容的时候,就是正常的播放。
以上,请先复述你的理解,先跟我对齐
在v1基础上做,新视频版本是v2。动画播放期间需要显示口播字幕,但是口播字幕不可以遮挡住动画里面的字或者元素,如果有遮挡,需要适当调整字幕位置(一般情况下可能是往下挪动)
非常好,但是还有很多细节需要优化。如图所示是人类剪辑版,你需要对标这个版本继续优化,能够对齐人类剪辑的水平:
1.如图二,部分字幕换行不当,比如AI这个词不应该拆开,得在同一行。如图三的1分30s处,不要出现三行的字幕
2.字体大小目前偏大,字幕位置整体偏下,需要上移(无论是正常口播的字幕,还是播放动画时候的字幕),因为观众在视频号观看的时候,下方会有视频的介绍,介绍文字会遮挡字幕,这是实际的经验教训
3.视频里背景有个二维码,平台审核容易驳回视频的发布,所以需要全程动态遮挡住二维码的部分。
4.新版本命名v3
播放动画时候的字幕不能放在上半部分,还是得在下半部分,同时不可以遮挡动画元素和字幕,如果实在实现不了,也得放在动画元素下方,否则你这样会把东西都挤在一起,排版和观感很不好。
再一个,白色遮挡不可以遮挡住字幕。以上进行修改迭代,新版本命名v4
很好,接下来将以上修改、标准等,封装更新skill,更新前先复述一遍你的理解,对齐颗粒度。

更进一步

renders动画片段,codex生成的速度很慢→沉淀和复用动画模板

实现新增28个模板,套用模板的动画片段平均生成在1分钟内

模板复用实测-全新六段口播-46秒.mp4(视频原文件未嵌入网页)

相同模板,文案一

1.mp4(视频原文件未嵌入网页)

相同模板,文案二

我们来一起迭代https://github.com/Stephen-creater/video-asset-generator这个skill

这个skill的主要作用是指挥HyperFrames生成动画视频素材

注意,之后所有变动都要commit+push,我也有可能开不同的分支做实验(但是能不开分支就不开)

背景:账号定位是做ai前沿内容、技巧、方法论的分享账号,在各个平台如抖音、视频号、小红书等平台做ai自媒体账号,以口播真人出镜为主。

这个skill扮演的角色是,在口播视频制作流程过程中,单纯口播画面里从头到尾都是真人出镜,画面不够丰富、有趣、可视化与直观,而调研到有类似remotion和HyperFrames等开源项目,可以实现把口播的部分文案内容变成可视化的html或者视频片段,能够像是视频贴纸一样(之后与你协作的上下文里,我们约定把使用这个skill能力所生成的视频画面部分叫做视频贴纸),呈现在视频的几个片段里,增强视频的质量、让观众更容易理解,且人是视觉动物,天然喜欢,以及对可视化呈现更有注意力,更有记忆和印象

这个skill已经实现了相当多的效果,其中很多效果还不错,但是也有很多效果不好。目前给的案例见renders文件夹,一共有21个。

除了效果上需要提炼经验,能够持续稳定产出高质量视频贴纸、减少质量差的视频贴纸外,还有一个考量是,目前每次做一个视频贴纸,都相当于是从0开始,一个是没有先前经验的复用,另一个是耗时太长太慢,做一个视频贴纸可能每次都要三四十分钟,且效果不稳定。

所以解决思路是,把曾经做过的视频贴纸里面,好的部分做成模板,坏的地方讲清楚为什么坏,然后封装为skill

这样,下次再给到新的文案以后,对于能够复用好的模板的地方,可以更加稳定地产出近似高质量的视频贴纸,同时耗时可能只需要3-5分钟(预估),因为主体结构元素可以复用或者不变,替换里面的文字和简单修改就达到好的效果。

对于无法复用或者很大程度上需要从0做的视频贴纸,则有好模板为什么好、坏视频贴纸为什么质量差的经验复用,从而能产出更好质量的视频贴纸,同时,这个贴纸又有机会成为模板,以此形成一个正反馈飞轮。

去除特殊的视频贴纸,剩余的视频贴纸里
好的以及好在哪里:(人工打标、给反馈)

{
1.预留了一个图片的位置,而且找到了真实的、对应文案的图片,插入到居中、合适的位置。
比如01的kimi k3,moonshot的播客封面就放在这里,正好对应文案内容。又比如03

2.有时间顺序或者时间线,有或者有提到多个点的,按照标题-01-02-03等顺序展开,可视化出来会很清晰
比如04、07

3.对于新产品、新技术博客、文章,网站等等,能够直接搜索到原文地址,且方便截屏向下滚动展示的(必须是真实的),效果会非常好
比如05的kimi k3的官方文章

4.文案里提到疑问,问句,或者设问等等,可以有一个问号的可视化
比如08

5.前后对比类型的,可以是一个标题,然后下面两个框,填充对比的内容
比如12

6.结尾钩子类型的
比如21
}

第十一节:Codex浏览器自动化:原生Control Chrome+进阶Ego-lite+应用快照Appshot

一、原生Codex Control Chrome(@浏览器)

安装+导入cookie+使用场景

imagepng
imagepng
imagepng
imagepng

案例一、找携程酒店(耗时40min)

@浏览器 打开携程官网,搜索三亚大东海附近最受欢迎的 10 家酒店

帮我把酒店名称、位置、价位、评论都采集到一个 Excel 表格里。

重点是酒店评论:把这些酒店的评论原文、评论人、评论时间都采集下来;如果评论太多,就采集时间最近的 10 条。

然后帮我分析并推荐一下,撰写一份分析报告并保存到 Word 文档中。全部使用中文。

imagepng

三亚大东海热门酒店与最新评论.xlsx

三亚大东海热门酒店分析与推荐报告.docx

案例二、爬推特帖子(耗时1h)

@浏览器 帮我去我的推特上面搜索一下我现在关注的博主有哪一些,然后根据 followers 的数量排序,从高到低找前 20 的博主。

然后,前 20 博主的最近的一条帖子也要抓下来,还要整理那篇帖子里面最火的一个评论,这些给我放在表格里面清晰可视化的呈现。
imagepng
imagepng

x-following-top-20.xlsx

案例三、模拟人类使用购物网站

@浏览器 打开 SauceDemo,用 standard_user 登录,执行完整的商品排序和购物车流程测试,生成 HTML 报告。
imagepng
imagepng

二、进阶玩法:Ego-lite(/ego-browser)

Ego-lite浏览器,目前(26.8.12)只有mac版本

Codex 负责理解任务、生成 JavaScript、执行 Shell 命令;真正的浏览器、控制接口、任务隔离和 CDP 通信,全部由 ego lite 提供。

首次启动时,ego (lite) 会扫描机器上已装的 Agent,把 ego-browser Skill 写进它们的 Skill 目录。它还会问你要不要迁移浏览器数据——选好对应的浏览器确认一下,登录状态、Cookie、扩展程序和 Chrome 个人资料就都跟过来了,Agent 可以直接复用。

不绑死某个Agent,WorkBuddy,Claude Code,Codex都能直接接入。

让人和Agent共享同一个浏览器,但各自在自己的空间里干活。

Ego lite vs Codex 操控内置浏览器

https://lite.ego.app/compare/ego-lite-vs-codex-browser

速度、资源占用、并行性、token消耗和登录方面都优于codex的内置浏览器。

imagepng
imagepng
imagepng
imagepng

案例一、收集AI信息

/ego-browser
帮我找OpenAI & Anthropic blogs, 总结最新的、值得做笔记的更新内容,全程使用中文、回复中文

imagepng

案例二、并行-重复任务(耗时10min)

/ego-browser 开 10 个 Space,用gemini官网,使用nano banana画 10 张图给我选
主题是 CodeX 2026 年的产品演进路线图
imagepng
imagepng
imagepng

案例三、并行-复杂任务

A 找工作(耗时21min 40s)

/ego-browser 我想找Agent产品经理的工作,我最大的诉求就是公司离家近。我家住在杭州东站附近,请结合百度地图、智联招聘、BOSS 直聘这些网站,帮我搜索离家最近的合适岗位 20 个,输出成 CSV 文件给我挑选。可以开启多个 Space 并行工作,提高效率。
imagepng
imagepng
imagepng
imagepng

杭州东站附近_Agent产品经理岗位20个_2026-08-12.xlsx

B 规划旅游行程(耗时4min 5s)

/ego-browser 我计划本月15日到20日从杭州出发,前往苏州和南京两地游玩。你用12306搜索票务信息,然后结合小红书上的种草攻略,还有这几日的天气,给我出一个行程规划。可以开启多个 Space 并行工作,提高效率。
imagepng
imagepng
imagepng
imagepng
@site 把你的结论部署下,可视化,好看的网站,我要分享给别人

部署完的链接:https://hangzhou-suzhou-nanjing-2026.waynexu1993.chatgpt.site/#tickets

imagepng
imagepng
imagepng

ps:

boss直聘、小红书等平台可以爬,但是官方反爬机制严格,会有账号风控风险,推荐使用小号

三、应用快照Appshot

官网介绍

https://www.youtube.com/watch?v=QKYbGCvNpFo

无论打开任何网页/app,同时按下两个command键(Mac专属)

即可携带网页/app完整上下文内容,直接跳转codex,非常丝滑

Appshot 不等于普通截图。它还包含界面的可访问性树,

因此 AI 不只“看见页面”,还知道按钮、频道、用户等对象是什么、该调用什么动作。

imagepng

案例

/ego-browser 以你对我的了解、我们的记忆和上下文,自动帮我填写这个问卷,不要提交。能填的就填上去,你没有把握的,或者说需要我填的,你就留空。
问卷链接:https://adventurex.feishu.cn/share/base/form/shrcnnq8Z7S7yQcbz6c5MphIi0g

推荐学习

https://www.youtube.com/watch?v=il1c1a2FufU&t=26s

OpenAI 工程师 Jason Liu关于codex的分享,26-07-24

imagepng

第十二节:Codex Computer Use实战:操作桌面软件+Record&Replay沉淀skill

一、Computer Use操作桌面软件

安装

imagepng
imagepng
imagepng
imagepng

官网介绍

https://www.youtube.com/watch?v=D_FCYsshMI4

imagepng
imagepng

案例一、简单任务

@电脑 看我当前桌面壁纸,用GPT-image-2生成一张同风格的新壁纸,帮我替换
@电脑 帮我打开网易云音乐,播放我喜欢的音乐,播放顺序为随机

案例二、多步骤任务

@电脑,完成一个真实桌面软件实测。

目标:
打开 WPS ,制作一页可编辑的自媒体文章封面草稿。

主题:
Codex 支持 Computer Use

具体要求:
新建一个 16:9 空白演示文稿。
在页面左侧放置两行大标题:
第一行:Codex 补齐 Windows
第二行:AI 开始操作电脑

在标题下方添加一行小字:
手机负责指挥,PC 负责执行

页面右侧用形状绘制一个简化的“电脑屏幕 + 机械手点击按钮”的示意图。

整体风格使用黑、白、灰暗色极简风,可以用一个橙色小元素做强调。
所有文字都必须是可编辑文本,不要做成截图。

完成后保存到桌面,文件名为:
codex-computer-use-demo.pptx

操作过程中如果需要权限或遇到不确定的弹窗,请暂停并让我确认。

imagepng

案例三、测试网页/应用

@电脑
打开https://hangzhou-suzhou-nanjing-2026.waynexu1993.chatgpt.site/#tickets网站
测试界面,确保按钮和导航等都可以正常工作

哪些任务适合Computer Use?

  • 测试macOS或Windows桌面软件;

  • 测试登录、表单和结账页面;

  • 打开只能通过图形界面访问的设置;

  • 复现鼠标点击或窗口切换后才出现的Bug;

  • 跨多个桌面应用完成一套工作流;

  • 查看没有API、MCP或专用插件的数据源。

缺点

  1. 速度很慢,复杂任务易出错。不需要多模态能力的任务,使用codex 5.3 spark-速度极快。

  2. 可能占用桌面,鼠标和键盘,适合在自己暂时不用电脑时进行

二、Record & Replay in Codex

安装

imagepng

官网介绍

https://www.youtube.com/watch?v=ZK3JhU73W18

演示了OpenAI官号,如何使用Record & Replay来自动发布YouTube视频

案例-水塔图片数据集录入

/Record & Replay Watch me do this task and create a skill from it
观看我的操作,固化为skill。全程输出和回复中文。

案例部分请看视频。

第十三节:Codex多智能体协作:子智能体、并行分工、Ultra模式

imagepng
imagepng
imagepng
imagepng
imagepng
imagepng

官方介绍

https://learn.chatgpt.com/docs/agent-configuration/subagents?surface=app

imagepng
imagepng
imagepng
imagepng
imagepng

案例

我要制作一期关于 Codex Subagents 的视频,目标观众是不懂编程、看不懂英文,但已经会使用基础 AI 工具的技术小白。

当前阶段只做深度资料调研。

请实际创建并同时运行以下 3 个 Subagents,不要只给出分工方案,也不要增减数量:

Subagent 1:官方资料研究

只调查 OpenAI 官方网站、官方文档和官方发布的内容,重点查清:

1. Subagents 是什么;
2. 它是怎么工作的;
3. 如何调用;
4. 官方提到的优势;
5. 适合与不适合的任务;
6. Token、权限、并行和使用限制;
7. AGENTS.md、Skills、自动化与 Subagents 的关系。

Subagent 2:社区反馈研究

调查 X、Reddit、GitHub 等公开社区中的真实使用反馈,重点查清:

1. 用户如何使用 Subagents;
2. 常见有效场景;
3. 用户认可的优势;
4. 常见问题、失败案例和使用成本;
5. 社区说法与官方说明是否一致。

社区个例不能直接泛化;每项结论必须附原始来源链接和发布时间。

Subagent 3:视频与创作者案例研究

调查 YouTube、Bilibili、博客和教程中的公开案例,重点查清:

1. 创作者如何演示 Subagents;
2. 他们如何拆分任务、安排角色并汇总结果;
3. 哪些案例适合技术小白理解;
4. 哪些说法属于作者观点,尚未得到官方确认;
5. 可用于视频讲解的具体案例与画面设计。

优先查看原始内容;每项结论必须附来源链接和发布时间。

要求每个 Subagent 返回:

1. 核心结论;
2. 支持结论的原始依据;
3. 仍无法确认的问题;
4. 一份简短摘要。

请等待 3 个 Subagents 全部完成后,再由主 Agent:

1. 检查三个任务是否完成;
2. 删除重复内容;
3. 核对相互矛盾的信息;
4. 补充遗漏的重要内容;
5. 整理成一份面向技术小白的中文研究报告。

只做只读调研。不要发布、删除、付款或修改外部内容。

Ultra模式

Ultra 模式下,Codex 会无限制使用多个子Agent 并行工作。 它把一个复杂任务拆成多条工作线,同时推进。

适合什么场景:

  • 复杂的开发任务(前后端 + 数据库 + 测试同时搞)

  • 深度研究(多维度同时调研)

  • 大型项目验收(安全检查、功能测试、文档生成并行)

注意: Ultra 模式烧 Token 非常猛。日常任务用 medium/high 就够

### 目标

以用户视角,从浏览器入口探索项目各个功能,挖掘潜藏的的 bug,并修复。

### 如何挖掘潜藏的 bug

从不明显的、常规人工验证不容易发现的场景入手,提升挖掘 bug 的可能性。例如:

- 看浏览器 F12 中的报错请求、重复请求
- 看服务日志中的报错
- 看一些不起眼的 UI 或者边界情况

在探索过程中多考虑不同功能场景间交叉的、可能相互影响的 case,这其中更可能潜藏着复杂的问题。

### 如何探索

在本地启动服务,并操作浏览器验证。

主要的探索方式应该是阅读代码 + 浏览器操作。

允许的操作:
- 浏览器操控
- 查询日志、数据库记录
不允许的操作:
- 删除或修改数据库数据
- 直接调用 API 构造测试场景(所有的 bug 必须是能通过浏览器操作复现出来的)

### 修复方式

发现 bug 后立即修复,必须通过相同的复现路径回归测试,验证修复效果。

用 bugs.md 记录 bug 发现、bug 修复过程

对发现的 bug 进行修复方案确定性打分,如果确定性低于 80%,则不修复,移动到 open-bugs.md,只记录复现路径、预期结果、实际结果。无论 bug 是否修复,都记录每个 bug 的修复方案确定性分数。

### 停止条件

满足以下之一:
- 时间超过 10 小时
- 已完成一轮你所计划的探索,并修复所有 bug

第十四节:Codex+飞书(Lark)CLI:玩转多维表格、飞书白板、手机飞书操控Codex

一、飞书CLI(Lark

帮我安装飞书官方cli:https://github.com/larksuite/cli

ps:手机上也要下飞书,要扫码授权电脑。可以先注册飞书个人版。

imagepng

案例一、Agent + 飞书 CLI + 多维表格 = 内容选题工作流

官方介绍:https://www.feishu.cn/content/article/7647368333007997909

imagepng

真实AI热点来源.csv

把“真实AI热点来源.csv”导入飞书多维表格(云文档),表名改成「信息源」。
这些资料有不少在说同一件事。帮我整理成一个选题库,保留原始来源,方便我判断哪些内容值得写。
选题库里,按选题的处理进度,帮我做几个常用视图。比如待判断、已淘汰、正在写、已写完
读取我标成「正在写」的选题,生成一份飞书文档大纲。

案例二、飞书白板

一个包含 35 种精选配色风格的库,用来生成漂亮、可二次编辑的飞书 / Lark 画板。

帮我安装https://github.com/zarazhangrui/beautiful-feishu-whiteboard
需要我授权的地方提醒我,我来授权
imagepng
imagepng

安装后,用大白话告诉你的 agent 就行。可以指定风格,也可以描述气质:

  • “用 Riso Brut 风格做一块飞书画板,讲清楚我们的新人上手流程。”

  • “把这篇文档变成一块飞书画板,极简、cobalt 蓝 的感觉。”

  • “把系统架构画成飞书画板,糖果色、活泼 一点。”

  • “用一块画板讲清楚 LLM 训练的三个阶段。”

你的 agent 会:先问清楚这块画板是干什么的、你想要什么气质,从风格目录里挑一个合适的风格,用原生图形把图画出来,渲染后自我检查(溢出、留白、重叠等问题),写入飞书文档成为可编辑画板,然后把文档链接和图片一起发给你。你随时可以换一个风格。

把以下脚本文案内容,做成一个飞书画板,使用beautiful-feishu-whiteboard,匹配适配的风格:

家庭教育彻底变天了啊,以前就只要让孩子考个好大学好专业,可现在ai都快把大学冲烂了。就拿现在还在大学课堂上讲课的老师来说,不少二流老师还在用着清朝做的ppt,讲着三五年前就不流行的东西。就这样的老师,还天天数落学生呢。就算真正做前沿科研的学者教授,他们也经常感到无力。因为现在ai发展太快了,他们以为ai会来和他们抢饭碗。让他们想不到的是,他们可能连和ai比的桌都上不了,ai自己已经单独开辟了一条赛道。

什么意思呢?前段时间Google发了一篇关于攻克白血病相关的《Nature》,ai在里面充当的角色竟然是联合科学家。有AI加入后,传统的研究方案直接被降维打击了啊,它不只是帮教授查查论文。把一个方案扔给它,它会自己挑毛病、淘汰方案,直到给出一套完整的解决方案。Google还一次拿了203个目标测了一遍,有些想法甚至在白血病药物这些方向通过了实验验证。

还有更暴力的,记不记得前段时间的天才数学家陶哲轩?有段时间他也感受到了前所未有的迷茫,因为数学领域都是靠非常严格的逻辑推理来证明的,这是目前人类学术界唯一认可的方式。在传统的数学领域要证明一个问题,即便用穷举法举一万亿个例子,数学家也绝对不可能说这就证出来了。但是AI加入战斗之后,它可不管你原来是这么做的,它想的是,它可以用无穷量的数据来证明,一个数据是特例。它不能证明普遍结论好,那100万个数据呢?100万个数据不够,1亿个数据呢?万亿不够,我给你1兆亿的数据呢?直接给你拉满,大不了把所有的数都跑一遍,最后反正都是这个结论。那你说到底是证明了还是没证明呢?它的暴力破解,把陶哲轩都干得有点怀疑人生啊

更要命的是,那些把ai研究的炉火纯青的技术大拿,压根就不可能在大学里。像OpenAI、Google DeepMind、Anthropic这帮公司。更有大学老师研究了几年的前沿问题好不容易破解,anthropic用大模型跑了一天就直接解决了。就像你在打大学羽毛球社团的羽毛球联赛,你自信满满上场,发现对手竟然是林丹一样,这不闹吗,但仔细想想也确实没招。ai确实已经强大到这个份上。

所以你来说说,一个大学老师研究好几年的成果,ai一天就跑通了。当你还在通宵给孩子选学校报专业的时候,ai已经把大学的后院点着了。现在还有很多家长还在被老一套的教育观念洗脑,好好读书考个好大学找个好工作,一辈子就值了。可ai可能会如他们的愿吗?与其天天烧高香祈祷孩子录到一个好大学好专业,还不如让孩子尽早开始学会驾驭ai,让孩子多跟ai探究问题,也不能盲目相信ai,该质疑的质疑,该纠错纠错。这样培养的孩子,才能在ai时代占据一席之地。
用飞书画板画一个外卖App用户从点外卖到最后收到外卖的流程图,用泳道活动图,要体现整个过程中各个角色的动作。
再画一个产品架构图
再画一个时序图

案例三、手机飞书操控codex

帮我安装https://github.com/chenhg5/cc-connect/blob/main/README.zh-CN.md
我需要实现在手机飞书上操控本机codex,帮我落地
imagepng
imagepng
帮我安装https://github.com/Stephen-creater/cc-connect-lid-awake
让已经安装 cc-connect 的 MacBook 在接通电源并合盖后继续运行,从而可以在手机飞书/Lark 中操控本机 Codex(该开关可以由用户自由选择,合盖后继续运行/合盖后让电脑休眠)

(仅大陆)二、补充:知识星球cli

帮我安装https://github.com/unnoo/zsxq-skill

核心能力

  • 星球管理:列出已加入的星球,搜索星球,查看标签、成员和专栏

  • 内容搜索:按关键词搜索星球里的帖子、文章和提问

  • 主题查看:查看主题详情、评论、点赞和标签信息

  • 发布互动:发布主题、编辑主题、评论回复、回答提问

  • 精华与标签:设置/取消精华,为主题打标签,管理专栏收录

  • 个人笔记:创建、编辑、查看、删除笔记

  • 账号信息:查看个人资料、发帖足迹、提交 NPS 反馈

典型使用场景

  • 「每日巡场」— 自动汇总今天新内容、待处理提问和评论

  • 「整理评论区问题给我回复」— 找出未回复评论并起草回复

  • 「做本周运营周报」— 统计新增/活跃/精华,生成结构化周报

  • 「生成星球日报海报」— 把内容精选做成 PNG 海报图片

  • 「把帖子做成视频」— 把星球内容转成竖版动画视频

(完)

课程资料已完结

从目录选择章节,继续你的 Codex 实战。

返回全部教程 ↗