ARIS: 从自动科研到广义研究工作流
research2026-06-0222 min read
ARIS 原本是 Auto-claude-code-research-in-sleep 里的自动科研系统,但真正可迁移的是它的研究方法论:计划、草拟、对抗审查、迭代收敛、写入长期记忆。
arisauto-researchresearch-agentsworkflow
Summary
ARIS 这条线应该单独看。它最早的具体形态是Auto-claude-code-research-in-sleep:让 agent 在你睡觉时读论文、找 idea、写代码、跑实验、接受外部模型审查、最后把结果组织成论文或 rebuttal。后来作者意识到,这个系统真正有价值的不是某个 Claude Code 技巧,而是一套“结构化研究”的通用方法,于是出现了 ARIS-in-AI-Offer 和 ARIS-Anything:前者把 ARIS 迁移成 AI 秋招知识库、技术博客和学术主页生成器;后者把迁移逻辑明确写成“科研 ⊂ 研究”的泛化框架。
Research Question
这篇笔记只回答 ARIS 这一条线的问题:- ARIS 原始的自动科研流程到底是什么?
- 为什么它不是一个大 prompt,而是一套 workflow system?
ARIS-in-AI-Offer是怎样从科研迁移到 AI 面试、教程、主页和博客的?ARIS-Anything又怎样把这个迁移提升成“广义研究”的方法论?- 如果把 ARIS 拓展到投资、法律、市场、学习、工程复盘等领域,哪些东西必须保留,哪些东西应该替换?
Findings
1. 四个仓库里,ARIS 线和 AutoSOTA 线应该分开
这次调查涉及的仓库里,有三者属于 ARIS 迁移链:| 仓库 | 角色 | 说明 |
|---|---|---|
Auto-claude-code-research-in-sleep | ARIS 主体 | 原始自动科研系统,覆盖 idea、实验、论文、rebuttal、talk、research wiki |
ARIS-in-AI-Offer | ARIS 的第一个强迁移样例 | 把同一套 review/render/workflow 思路迁移到 AI 面试 cheat sheet、技术博客和学术主页 |
ARIS-Anything | ARIS 方法论泛化 | 明确提出“科研只是研究的一种”,把 ARIS 推广到任意结构化研究 |
AutoSOTA 应该单独开页分析。它也属于 Auto Research,但它的目标不是“从想法到论文”,而是“给定论文代码和评测指标,自动优化到更好的结果”。这两条线可以互补,但不应混在同一页里讲。
2. ARIS 原始系统:Auto-claude-code-research-in-sleep
Auto-claude-code-research-in-sleep 的 README 很长,但可以抽象成一句话:
AGENT_GUIDE.md 和 docs/SKILLS_CATALOG.md,ARIS 把科研活动拆成了这些模块:
| 阶段 | 代表 skill | 功能 |
|---|---|---|
| 文献和搜索 | /research-lit, /arxiv, /deepxiv, /openalex, /semantic-scholar | 找文献、查元数据、去重、生成领域地图 |
| 想法生成 | /idea-creator, /idea-discovery, /novelty-check, /research-refine | 生成 idea、做 novelty check、根据 reviewer 修正 |
| 实验计划 | /experiment-plan, /ablation-planner | 把想法变成实验路线、消融、预算和运行顺序 |
| 实验执行 | /experiment-bridge, /run-experiment, /experiment-queue, /monitor-experiment | 写代码、跑 sanity check、上 GPU、收集结果 |
| 结果审查 | /experiment-audit, /result-to-claim, /paper-claim-audit | 检查 eval 是否诚实、结果能否支持 claim、论文是否如实报告数字 |
| 对抗审查 | /auto-review-loop, /research-review, /kill-argument, /proof-checker | 让外部模型挑毛病、写 rejection memo、查证明、逼迫修复 |
| 写作发表 | /paper-plan, /paper-write, /paper-compile, /paper-writing, /rebuttal, /resubmit-pipeline | 规划论文、写 LaTeX、编译、rebuttal、转投 |
| 记忆和渲染 | /research-wiki, /render-html, /wiki-enrich | 持久化知识、生成 HTML 视图、补充 wiki |
3. 为什么 ARIS 不是一个 prompt
如果只是一个大 prompt,它的形态会是:IDEA_REPORT.md可以作为下一阶段的输入;EXPERIMENT_PLAN.md可以被/experiment-bridge消费;EXPERIMENT_LOG.md可以被/auto-review-loop和/result-to-claim消费;REVIEW_STATE.json可以让长循环在上下文压缩后恢复;research-wiki/可以让后续 idea generation 不从零开始。
ARIS 的关键不是“上下文里记住了什么”,而是“文件系统里沉淀了什么”。这也是它能跨平台迁移到 Claude Code、Codex CLI、Cursor、Trae、Antigravity、Copilot CLI 等环境的原因。
4. 原始 ARIS 工作流一:idea discovery
/idea-discovery 是从模糊方向走向候选科研 idea 的阶段。它通常包含:
- 搜索和读文献;
- 归纳领域问题;
- 生成多个候选 idea;
- 检查 novelty;
- 做初步 feasibility 评估;
- 选择最值得推进的 idea;
- 输出
IDEA_REPORT.md和实验计划。
- 这个 idea 解决什么 gap?
- 它和哪些已有论文最接近?
- 它的新意在哪里?
- 它能不能用当前代码和算力做 pilot?
- 如果要失败,最可能因为什么失败?
5. 原始 ARIS 工作流二:experiment bridge
/experiment-bridge 是把想法变成可跑实验的阶段。它读上游实验计划,然后负责:
- 解析 milestone;
- 按现有代码库风格实现实验;
- 做最小 sanity check;
- 选择本地、远程、Vast、Modal 等 GPU 路由;
- 收集结果;
- 更新 tracker;
- 在需要时触发 ablation。
protected_paths 思路有共同点:自动化系统不能只追求好数字,必须保护评测协议。
6. 原始 ARIS 工作流三:auto review loop
/auto-review-loop 是 ARIS 最核心的思想之一。
它的形式是:
7. 原始 ARIS 工作流四:paper writing 和 audit chain
当实验和 review 有了足够结果,ARIS 进入论文写作:AGENT_GUIDE.md,ARIS 把提交前审查分成五层:
| 层 | skill | 审查问题 |
|---|---|---|
| 1 | /experiment-audit | 评测代码是否诚实,有没有 fake ground truth、phantom results、指标污染 |
| 2 | /result-to-claim | 实验结果是否真的支持 claim |
| 3 | /paper-claim-audit | 论文里的数字和比较是否如实来自 raw results |
| 4 | /citation-audit | 引用是否真实、元数据是否正确、上下文是否合适 |
| 5 | /kill-argument | 最强 rejection memo 是否还能击穿论文 |
8. Research Wiki:ARIS 的长期记忆
/research-wiki 是 ARIS 从“长对话”变成“长期系统”的关键。
它定义了四类实体:
| 实体 | 含义 |
|---|---|
| Paper | 已读论文 |
| Idea | 提出、测试、失败或保留的研究想法 |
| Experiment | 具体实验和结果 |
| Claim | 可被证据支持或否定的科学主张 |
| 边 | 含义 |
|---|---|
extends | 一个 paper 建立在另一个 paper 上 |
contradicts | 一个 paper 反驳另一个 paper |
addresses_gap | paper 或 idea 解决某个 gap |
inspired_by | idea 来自某篇 paper |
tested_by | idea 或 claim 被某个实验测试 |
supports | 实验支持 claim |
invalidates | 实验否定 claim |
9. ARIS-in-AI-Offer:第一个强迁移样例
ARIS-in-AI-Offer 说明 ARIS 的 loop 可以离开“论文写作”本身。
它有三个主要产物:
- AI 秋招 / ML 面试 cheat sheet;
- 长篇技术博客;
- fact-checked academic homepage。
- 需要结构化知识;
- 需要公式、代码、引用或事实;
- 需要 reviewer 检查;
- 需要最终可读的 HTML artifact;
- 需要避免幻觉和个人信息泄漏。
10. 面试 cheat sheet 怎么继承 ARIS
/interview-cheatsheet 的工作流大概是:
| ARIS 原科研流程 | AI-Offer cheat sheet 对应物 |
|---|---|
| research direction | tutorial topic |
| paper draft | long-form tutorial draft |
| experiment code | from-scratch PyTorch example |
| peer review | math/code/factual/style review |
| paper PDF | single-file HTML |
| audit artifact | .review.json |
11. Homepage generator 怎么继承 ARIS
ARIS-Homepage 的迁移更有意思,因为它处理的不是知识教程,而是个人事实。
它的 pipeline 是:
- 对教程来说,reviewer 主要查公式、代码和技术事实;
- 对 homepage 来说,reviewer 和 audit 主要查 CV 事实、论文 venue、年份、作者、奖项是否可靠;
- 对 HTML 来说,还要查渲染 fidelity 和隐私泄漏。
12. ARIS-Anything:把“科研”推广成“研究”
ARIS-Anything 的核心判断是:
- 投资尽调;
- 法律研究;
- 医学文献综述;
- 市场研究;
- 自驱学习;
- 调查新闻;
- 工程复盘;
- 个人知识管理;
- 产品需求研究;
- 设计方案研究。
13. 迁移时保留什么
跨领域迁移 ARIS 时,以下东西不应该变:| 不变量 | 原因 |
|---|---|
| artifact-first | 没有文件化 artifact,就不能复审、恢复、比较和审计 |
| executor != reviewer | 防止模型自审自批导致 blind spot |
| reviewer fresh context | 防止 reviewer 被 executor 的叙事带偏 |
| typed memory | 让系统长期积累 paper、idea、experiment、claim 或领域等价物 |
| evidence trace | 每个结论要能追到来源 |
| failure taxonomy | reviewer 必须知道什么算失败 |
| final deliverable gate | 不能因为流程跑完了就自动认为结果合格 |
14. 迁移时替换什么
迁移到新领域时,需要替换的是领域相关部分:| 可替换部分 | 学术科研中的形态 | 其他领域中的形态 |
|---|---|---|
| evidence source | paper, arXiv, code, experiment logs | case law, financial filings, interviews, incident logs, product docs |
| claim type | scientific claim | legal claim, investment thesis, product claim, root-cause claim |
| evaluator | peer reviewer, proof checker, citation auditor | legal reviewer, risk reviewer, domain expert, red-team critic |
| deliverable | paper, rebuttal, talk | memo, report, brief, PRD, postmortem, study guide |
| wiki schema | paper / idea / experiment / claim | source / hypothesis / test / conclusion |
15. 投资尽调如何 ARIS 化
投资研究可以这样迁移:| ARIS 实体 | 投资版 |
|---|---|
| Paper | Filing / earnings call / report |
| Idea | Investment thesis |
| Experiment | Backtest / scenario analysis / channel check |
| Claim | Revenue growth claim / margin claim / moat claim |
- bull case 是否过度依赖单一假设;
- bear case 是否被认真处理;
- valuation 是否和 comps 一致;
- catalyst 是否有时间尺度;
- downside 是否量化。
16. 法律研究如何 ARIS 化
法律研究可以这样迁移:- jurisdiction 错误;
- precedent 过期;
- holding 和 dicta 混淆;
- 引用不支持命题;
- 忽略相反判例;
- 把事实问题说成法律确定性。
17. 工程复盘如何 ARIS 化
工程 incident postmortem 也很适合 ARIS:- timeline 是否漏关键事件;
- root cause 是否只是 proximate cause;
- action item 是否能防止复发;
- 是否把人责当成系统原因;
- 是否有无法验证的推断。
/result-to-claim 很像:结果是否真的支持结论?
18. 自驱学习如何 ARIS 化
自学也可以被看成研究:ARIS-in-AI-Offer 其实已经证明了这一点。面试 cheat sheet 本质上是面向某个 topic 的学习和复习 artifact。它把一个技术领域拆成:
- 直觉;
- 公式;
- 代码;
- 工程细节;
- 常见坑;
- 高频问题;
- 进阶追问。
19. ARIS 方法的真正边界
ARIS 的边界不是“能不能调用更强模型”,而是下面几个条件是否满足:- 是否能定义清晰 artifact?
- 是否能找到可靠 evidence source?
- 是否能定义什么算错误?
- 是否能让 reviewer 独立审查?
- 是否能把结果写入长期记忆?
- 如果没有 evidence source,就会变成编造;
- 如果没有 failure taxonomy,就会变成主观打分;
- 如果没有 reviewer independence,就会变成自我确认;
- 如果没有 artifact,就无法恢复和复查;
- 如果没有 memory,就只能一次次重来。
20. 一句话理解 ARIS
ARIS 可以这样定义:Sources
本页基于本地仓库调查,没有使用外部网页检索。 主要来源:/Users/yitwah/Projects/Auto-claude-code-research-in-sleep/README.md/Users/yitwah/Projects/Auto-claude-code-research-in-sleep/AGENT_GUIDE.md/Users/yitwah/Projects/Auto-claude-code-research-in-sleep/docs/SKILLS_CATALOG.md/Users/yitwah/Projects/Auto-claude-code-research-in-sleep/skills/research-pipeline/SKILL.md/Users/yitwah/Projects/Auto-claude-code-research-in-sleep/skills/auto-review-loop/SKILL.md/Users/yitwah/Projects/Auto-claude-code-research-in-sleep/skills/research-wiki/SKILL.md/Users/yitwah/Projects/ARIS-in-AI-Offer/README.md/Users/yitwah/Projects/ARIS-in-AI-Offer/skills/interview-cheatsheet/SKILL.md/Users/yitwah/Projects/ARIS-in-AI-Offer/skills/render-html/SKILL.md/Users/yitwah/Projects/ARIS-in-AI-Offer/skills/homepage-generator/SKILL.md/Users/yitwah/Projects/ARIS-Anything/README.md/Users/yitwah/Projects/ARIS-Anything/README_CN.md
Open Questions
ARIS 的方法论很强,但还有几个问题值得继续追:- 不同领域的 reviewer 如何定义?如果 reviewer 只是通用 LLM,它可能无法发现领域特有错误。
- Research wiki 如何避免污染?失败 idea 应该保存,但环境错误、工具故障、误判不能沉淀成长期知识。
- 跨模型审查的成本如何控制?最强 reviewer 很贵,什么时候需要 full audit,什么时候只需要 lightweight review?
- 如果多个 agent 并行探索,如何合并 memory 和 reviewer verdict?
- 广义研究里哪些领域适合全自动,哪些必须 human-in-the-loop?
Metadata
Quick Reference
Typeresearch
Statuspublished
Date2026-06-02
Retrieval Tags
arisauto-researchresearch-agentsworkflow
Related
Cross-model reviewResearch wiki广义研究