别用 Sora 硬刚科普了:给个主题,这个开源 skill 用代码"画"出整条讲解视频
anything2explainer 是一个 Claude Code/Codex skill:给一个主题,产出黑底 MG 风格的科普讲解视频,带 TTS 配音、字幕和章节进度条。画面全部由 Remotion 代码绘制,事实可追溯、可逐帧修改、可复现,无需视频生成模型和 GPU。
这里汇总历史技术笔记、专题阅读路线、系统教程和常用导航。可以按最新文章浏览,也可以直接进入教程中心或专题路线学习。
轻量展示,每小时更新:2026-06-16 23:17:39
anything2explainer 是一个 Claude Code/Codex skill:给一个主题,产出黑底 MG 风格的科普讲解视频,带 TTS 配音、字幕和章节进度条。画面全部由 Remotion 代码绘制,事实可追溯、可逐帧修改、可复现,无需视频生成模型和 GPU。
浙江大学与北京大学开源的社媒内容工作台 Easel,基于 OpenClaw 提供 114 个可执行技能,覆盖发现、策划、创作、发布、归因五层闭环,支持小红书、抖音、知乎等 7 个平台直发,Apache-2.0 协议。
Jev Ultrafast 是 browser-use 最新开源(MIT)的极速浏览器 Agent:不给模型截图、不让模型生成选择器或代码,而是把每个网页观察压缩成一张带编号的元素表,由 TypeSafe 的 Jev 模型在一次网络往返里同时选出「操作」和「目标」,仅在 TYPE_TEXT 时才调用小模型写字。官方实测:Google Flights 苏黎世→伦敦单程搜索端到端 7.073 秒完成并通过独立校验,相比旧循环中位耗时降 25%,浏览器协议调用从 1092 次降到 101 次。本文基于仓库源码(agent.py / model.py / snapshot.js)、design.md 与 performance.md 的实测数据,讲清它的动态索引动作空间、推测式 target 头、新鲜度守卫的工程细节,给出最小上手路径,并明确指出 shadow root、iframe、canvas 等能力边界与谁该用、谁该等。
HelpWriting(lfdc-code/helpWriteing)是一个本地运行的公众号 AI 内容工作台:Python + CrewAI 多智能体 + AIForge 搜索 + FastAPI + PyWebView 桌面壳,把热搜选题、联网取证、多 Agent 写作、维度化创意变换、本地去 AI 味(硬编码短语表 + 说人话引擎 + humanizer skill 三层)、34 套 HTML 模板排版、微信草稿 API 上传串成一条八段管线,并提供小说连载与漫画图文出口。本文基于 master-pro 分支源码(unified_workflow.py 1026 行、local_humanizer.py、dimensional_engine.py、license 模块)与仓库自带的腾讯朱雀检测实证截图,讲清它的编排机制、去 AI 味三层设计、AI 检测器本身的误判问题;同时重点指出:项目虽挂 Apache 2.0,NOTICE 却附加非商业、禁止未经授权分发和 SaaS 的条款,法律上更接近 source-available 而非真正开源。最后给出谁该用、谁该等的判断。
World Monitor 是 AGPL-3.0 协议的实时全球情报仪表盘:把 461 个新闻/OSINT 信息流、57 种地图图层、748 个归属数据源收进 deck.gl/globe.gl 双引擎地图,并对外提供 MCP Server、REST API、CLI 和四种语言 SDK。本文基于 GitHub 仓库(87.1k Star、7596 次提交)、ARCHITECTURE.md 与 docs/algorithms.mdx 源码级文档,加上对线上仪表盘、CII v8 国家不稳定指数实时接口和公开 MCP tools/list 的实际取证,讲清三件事:它和普通新闻聚合墙的本质区别、CII 评分算法里反直觉的工程设计、以及把它接进 AI Agent 的最小路径。最后给出谁现在该用、谁该等的明确判断。
agnes-image-tool(Agnes Creator Studio)是一个 MIT 协议的 Gradio 开源工作台,用四个 Python 依赖把文生图、图生图、文生视频、图生视频、多图关键帧、批量生成和历史记录收进同一个 7860 端口。本文基于源码实测:通读 app.py / api_client.py / config.py 共 2379 行,核对出七个标签页的真实能力边界、视频帧数写死 8n+1 的工程原因、图像 Data URI 与视频公网 URL 的不一致设计、Docker/HF Spaces/VPS 四条部署路径的实际成本,以及仓库里还藏着一个 Next.js 15 重写版 agnes-forge。文章给出谁现在该装、谁该等的明确判断。
liquidslr/system-design-notes 是 GitHub 上最火的系统设计面试资料之一:2 万 star,把 Alex Xu 两卷《System Design Interview》28 章重制成 5.2 万词英文笔记和 392 张手绘架构图。本文没有停留在 star 数:我克隆仓库逐章统计,确认它的真实结构是「4 章方法 + 9 个分布式组件 + 15 个完整系统」,每章统一采用 Step1 理解问题、Step2 高层设计、Step3 深入设计、Step4 总结的四步推演骨架;同时核实了三个必须讲清的边界——GitHub API 显示 license 为 null(内容源自付费书,仅适合个人学习)、全仓库 0 行可运行代码、延迟数字表标注的是 Latency (2020)。文章给出三周冲刺路线和谁该用、谁该等的明确判断。
开源自建的 AI 图片视频生成平台
story-to-handdrawn-video 是 gnipbao 开源的 Agent Skill:把中文故事文案或一组有序手绘图片,转成 3:4 竖屏手绘日记动画,1080×1440、30fps、H.264 静音画面轨,内置 20 种画风。它不是一个脚本,而是 Remotion 渲染器(React 19 + Remotion 4.0.487)加可分发 Skill 的两段式工程,用 text→黑白稿→彩色稿从左到右擦除的统一动画语法,默认 Codex Image2 出图、本地 FFmpeg 派生黑白层,中文走马善政毛笔字体渲染以保证零错字。我在全新 clone 上实测 npm ci、plan、build 全部跑通,同时发现一个 README 没提的真实缺陷:npm run check 在干净克隆上退出码 1——自带 storyboard 引用了被 gitignore 的生成资产。本文给出完整流水线、20 风格家族梳理、输出契约和规避方法,以及谁该用谁该等的判断。
Obscura 是 h4ckf0r0day 开源的 Rust 无头浏览器,不依赖 Chromium,用 V8(deno_core)跑真实 JS,却自研 HTML 解析、CSS 级联、布局与 CPU 绘制管线,并通过 CDP 协议成为 Puppeteer/Playwright 的平替。本文基于 0.2.2 发行二进制在 Linux 上一手实测:抓 Hacker News 含 JS 执行与 DOM 抽取真实墙钟 0.152s、最大驻留内存 40,052KB、markdown/assets 抽取与并行 scrape 正常、SSRF 默认拦截内网;并通读九个 crate 约 15.3 万行 Rust 与 render-repros 中 66 个像素级 CSS 对拍夹具,拆清它「V8 + Taffy + tiny-skia + ab_glyph」的渲染架构、单 V8 isolate 的并发取舍、看门狗预算模型,以及自研引擎在长尾 CSS、媒体播放、字体栅格化上的真实边界。注:本站 9 月 4 日曾介绍其轻量化特性,本篇只谈渲染引擎本身与实测证据,不重复功能清单。
DSH-Creator(Jacky Creator)是一个 DeepSeek Harness 桌面端插件,把选题、脚本、录屏、字幕、封面、多平台发布、数据回收、复盘装进同一条本地内容流水线。本文基于 v0.1.0-beta.8 源码实测:56 个测试文件、351 个用例全绿,14 个 jacky_creator_* 工具,核心设计是一条片子一个普通文件夹、磁盘文件为唯一真相源、所有写操作先预览后确认。文章讲清它和云端内容 SaaS 的路线差异、最小上手路径、可选能力矩阵,以及谁现在该用、谁该等。
Hypit 是 hypit.ai 开源、面向 Claude Code/Codex 等 AI Agent 的视频生产框架(GitHub 1k+ star,v0.1.8,Apache-2.0 修改版)。它用一门叫 SVML 的视频标记语言把短视频描述为可编译的程序:Script 里只有词没有时间码,字幕、B-roll、特效全部锚定语义而非帧点,改一句台词整条片子自动重排;官方三个爆款样片真实生成成本仅 1.07–1.15 美元,由 64 个无头 Chromium 进程并发渲染。我通读仓库 100+ 个 workspace 包、quickstart 文档与三个样片的 reference.svml,拆清它的四层架构、Model/Provider 分离、失败不重复花钱的 Build 状态机,并指出修改版协议的商用限制、对 Agent 与模型生态的依赖等真实门槛。
ViMax 是港大数据科学实验室 HKUDS 开源的 Agentic 视频生成框架(GitHub 12.4k star / 1861 fork,arXiv 2606.07649,MIT),把一句话创意、完整剧本或长篇小说自动改编成分镜一致的分钟级视频。我克隆仓库通读了 1.37 万行 Python:13 个专职 Agent、三条 pipeline、FAISS+rerank 检索、静态/动态角色特征分离、VLM 视觉判官多候选选图、机位树首帧、asyncio 分级信号量并发、多供应商可插拔后端,并指出 Novel2Video 源码顶部的未完成标注、纯画外音角色跳过肖像等真实坑,给出安装路径与谁该用、谁先等的判断。
niwo-render-everything 是 MontageAI 开源的 Agent Skill:把 PDF、论文、网页、Word 或 AI 对话话题整理成可上传 Niwo 视频工作台渲染的短视频素材包。我克隆仓库通读了 425 行 SKILL.md、两份字段协议和 689 行本地校验器,拆清它「Agent 产内容、工作台管渲染」的两段式设计、content.json 的 7 字段严格协议、hook_headline 与成片形态的双向绑定、版本自检退出码机制,并给出安装路径、环境门槛与谁该用、谁先等的判断。
Jellyfish 是一个 Apache-2.0 的 AI 短剧端到端生产工作台(6.3k star):剧本拆解、分镜候选确认、角色/场景/道具/服装实体一致性、关键帧与视频生成、Celery 异步任务中心。我克隆仓库读了 FastAPI 后端的 chains、状态机与任务执行层,拆清它和即梦/可灵网页版的本质差别、三状态分离设计、Docker Compose 部署路径,并给出谁该用、谁先等的判断。
Y2A-Auto 是一个把 YouTube 视频自动搬运到 AcFun/bilibili 的开源工具(GPL v3,3256 star)。我克隆仓库读了 5 万行 Python,拆解它的 8 阶段 checkpoint 状态机、字幕 ASR+翻译+QC 分层质检、转载声明合规默认值、YouTube 监控配额预算和 HEVC 硬编回退,并说清它适合谁、要承担什么账号与版权风险。
Model X Studio 是一个纯前端 3D 爆炸视图项目:334 个网格零件沿滑块渐进拆解、可点选隔离、零后端部署。我实际跑了线上 demo、扒了全部源码,讲清楚它的布局算法、性能取舍和工程上的诚实之处。
PostBot 是一款开源的多平台内容同步浏览器扩展,覆盖公众号/微博/小红书/知乎/抖音/B站等十几家平台。我读了它近 1.9 万行源码,拆解它如何在不开放平台 API、不要账号密码的前提下,用本地登录态+内容脚本 DOM 自动化+多标签页扇出实现一键分发,以及它的边界与风险。
book-to-skill 把 PDF/EPUB/DOCX 技术书与文档转换成结构化 Agent Skill:4K token 常驻核心 + 1K 按需章节,比把整本书塞进上下文省 24–51 倍 token,单书生成成本约 1 美元。本文含我实跑提取器的第一手输出、源码级工程洞察与适用边界。
OpenMontage 是首个开源的、AI Agent 驱动的视频制作系统,把你的 AI 编程助手变成完整视频工作室——12 条流水线、57 个工具、60+ 提供商、零 API Key 也能出片。