Files
XH-202619/XH-202619-AI_Scientist工程实践方案.md

453 lines
27 KiB
Markdown
Raw Permalink Blame History

This file contains ambiguous Unicode characters
This file contains Unicode characters that might be confused with other characters. If you think that this is intentional, you can safely ignore this warning. Use the Escape button to reveal them.
# 基于多智能体分工协同与 Qwen 的 AI Scientist 工程实践方案
> **系统名称**:基于国产开源大模型的 AI Scientist 自进化科研发现引擎
> **方案定位**:以多智能体分工协同(Multi-Agent Collaboration)与子智能体技能(Skill)解耦为"自进化超级智能体"框架,以阿里通义千问(Qwen)大模型为"国产开源大脑",构建一套面向自然科学与前沿 AI 领域的**自进化科研发现与文献 RAG 探索闭环系统**。
---
## 一、研究问题与解决方法
### 1.1 研究问题
当前学术科研工作面临三大核心瓶颈:
1. **大模型逻辑幻觉 (Hallucination)**:大语言模型在多步复杂科学推理中频繁产生逻辑跳跃与虚假引用,导致生成的科学假说缺乏可信度与可证伪性;
2. **文献检索与知识碎片化**:传统关键词匹配无法深度理解科研问题的语义内涵,学者难以从海量文献中精准定位最相关的前沿成果并构建结构化知识图谱;
3. **假说质量缺乏量化闭环**:现有 AI 辅助科研工具多为"一次生成、人工判断"的开环模式,缺少对假说进行自动化多维度对抗性审查与自迭代纠偏的能力。
### 1.2 解决方法
本方案提出 **"基于自主进化多智能体与 Qwen 的科研发现闭环引擎"**,核心创新包括:
- **通义 1024 维 Dense Vector RAG**:接入通义 `text-embedding-v3` 高维向量模型,通过 70:30 稠密-稀疏混合重排算法 (Hybrid Search RAG),确保假说生成严格溯源至 arXiv 真实学术文献,从根源上遏制幻觉;
- **Reviewer #2 对抗性审查闭环**:内置"魔鬼审稿人"子智能体,对每轮假说执行 5 维度 50 分制量化打分与裁决 (ACCEPT/REVISE/REJECT),不达标则自动退回重新生成,形成最大可调轮数(1-10 轮,默认 3 轮)的自进化迭代;
- **双模式交互架构**:同时支持"人在回路协同模式"(人类导师可随时修改假说、注入先验指导)和"全自动无人值守模式"(24/7 自主运行),前端提供实时大模型对话流式视窗与结构化结果卡片。
---
## 二、方案核心亮点与技术优势
### 亮点 1100% 国产开源可控的"通义 Qwen 专才大脑"
完全基于阿里云百炼 / 通义 MaaS 平台的 Qwen 开源大模型矩阵(`qwen3.7-max` / `qwen3.7-plus` / `qwen3.6-flash`),并在前端支持三款模型的**动态无缝热切换**。通过针对特定学科的专业 Prompt 工程、知识图谱与高维向量 RAG 检索,打造具备高深学术逻辑推理能力的"领域专家型 AI"。所有 API 调用基于阿里云百炼平台兼容 OpenAI SDK 的标准接口,具备完整的调用凭证与端点配置。
### 亮点 2:通义 1024 维 Dense Vector 高维向量化 RAG 检索(技术深度亮点)
放弃传统的简单关键词匹配,原生接入通义 **`text-embedding-v3`** (1024 维 Dense Vector Embeddings) 模型,构建基于 NumPy 余弦相似度 (Cosine Similarity) 计算的**7:3 稠密向量与稀疏关键词混合重排 (Hybrid Search RAG)** 引擎。每篇论文的标题与摘要均经过 1024 维高维稠密向量编码,查询时同时计算向量余弦相似度(语义匹配)与稀疏关键词重叠度(精确匹配),以 `hybrid_score = 0.7 × cosine_score + 0.3 × sparse_score` 进行混合排序,彻底突破传统 LLM 的逻辑幻觉,确保每条假说均可精准溯源至 arXiv 真实学术文献。
### 亮点 3:自进化的"科研肌肉记忆"与 Reviewer #2 对抗审稿(科学价值核心)
基于大模型驱动的**闭环学习循环 (Learning Loop)** 与 **Reviewer #2(学术找茬人)** 对抗性审查机制。系统对假说进行逻辑自洽性、文献支撑度、可证伪性、新颖性、实验可行性 5 大维度(满分 50 分)的严苛打分,并根据打分判定(ACCEPT / REVISE / REJECT)自动触发多轮自我纠偏与迭代进化(可在侧边栏 1-10 轮间动态调节,默认 3 轮)。审查意见以结构化 JSON 格式返回,包含逐条批评与改进建议,驱动假说生成器的下一轮进化。在"人在回路"模式下,人类导师的先验反馈与审稿意见可一并注入 Prompt 上下文。
### 亮点 4:双模式并行 + 实时大模型对话流式视窗(应用潜力亮点)
提供现代化的 Streamlit Web 交互界面,内含两大模式:
| 模式 | 核心特性 |
|:---|:---|
| **人在回路协同模式** | 4 步渐进式卡片解锁(输入 → 假说生成 → 对抗审查 → 报告导出),人类导师可在线修改假说文本、注入先验指导意见,每一步均支持流式 Terminal 终端日志实时渲染 |
| **全自动一键流模式** | 24/7 无人值守运行,左右双栏并行展示(底座引擎 Terminal 日志 + 大模型实时流式对话视窗),运行过程中实时弹出科学假说结构化卡片与 Reviewer #2 五维审查打分仪表盘 |
界面拥有初学者 3 步指南横幅 (Onboarding Guide)、Wizard 状态进度条、极巨大高亮模式切换按钮(紫蓝渐变 + 浮起阴影)、暗黑极客流式 Terminal 终端控制台 (`.terminal-box`)、对话气泡视窗 (`.chat-stream-box`),以及科学假说卡片 (`render_hypothesis_card`) 与审查结果面板 (`render_review_card`)。
### 亮点 5:知识图谱实体抽取与证据链路可视化(多模态数据处理)
利用大模型进行学术文献摘要的命名实体识别 (NER) 与关系抽取 (RE),自动提取 `(Subject, Predicate, Object)` 三元组并构建 NetworkX 有向知识图谱。图谱支持导出为 Mermaid 格式代码,可直接嵌入最终生成的研究计划报告中,形成可视化的证据链路图。
---
## 三、AI Scientists 架构设计与讲解
### 3.1 四层架构总览
本系统采用**四层分离架构**,分别为表现层、智能体核心层、工具与向量层、国产大模型基座层:
```mermaid
graph TD
subgraph L1["一、表现层"]
direction LR
A1["渐进式 Web 界面"] --> A2["实时终端控制台"] --> A3["流式对话视窗"] --> A4["审查打分仪表盘"]
end
subgraph L2["二、智能体核心层"]
direction LR
B1["科研发现主循环"] --> B2["子智能体调度矩阵"] --> B3["自进化闭环学习"]
end
subgraph L3["三、工具与向量层"]
direction LR
C1["arXiv 文献检索工具"] --> C2["知识图谱抽取引擎"] --> C3["通义高维向量 RAG"]
end
subgraph L4["四、大模型基座层"]
direction LR
D1["千问 Max 推理大脑"] --> D2["千问 Plus 报告撰写"] --> D3["千问 Flash 极速响应"] --> D4["通义高维向量模型"]
end
L1 ===> L2 ===> L3 ===> L4
style L1 fill:#1e1b4b,color:#fff,stroke:#6366f1,stroke-width:2px
style L2 fill:#0f172a,color:#fff,stroke:#06b6d4,stroke-width:2px
style L3 fill:#111827,color:#fff,stroke:#10b981,stroke-width:2px
style L4 fill:#18181b,color:#fff,stroke:#a855f7,stroke-width:2px
```
#### 3.1.2 四层架构组件职责明细表
| 架构层级 | 包含组件 / 模块 | 核心功能与职责描述 |
|:---|:---|:---|
| **L1 表现层** | Streamlit UI / Terminal / 对话视窗 / 卡片面板 | 提供人在回路与全自动双模式,实时渲染打字流、思维链终端与五维打分卡片 |
| **L2 智能体核心层** | AIScientistEngine / Agent Skills / Learning Loop | 调度 4 大子代理智能体执行探索全流程,基于门槛分数实现多轮自进化修回与打分选优 |
| **L3 工具与向量层** | ArxivTool / KnowledgeGraphTool / SimpleRAGTool | arXiv 真实 API 检索、NetworkX 三元组图谱构建、通义 1024 维 7:3 混合重排索引 |
| **L4 大模型基座层** | qwen3.7-max / qwen3.7-plus / qwen3.6-flash / embedding-v3 | 阿里云百炼 MaaS 兼容 Endpoint,提供高能逻辑推导、报告生成与高维语义向量化 |
### 3.2 超级智能体 Skills 设计与功能映射
本系统将复杂的科研发现流程解耦为 4 个高内聚、低耦合的专业 Skill,每个 Skill 均被设计为一个具有独立 Prompt 工程和流式输出能力的子智能体(Agent):
| 核心功能需求 | 智能体 Skill / 核心模块 | 工程实现方式 | 落地状态 |
|:---|:---|:---|:---:|
| 真实文献检索与挖掘 | `LiteratureMiningSkill` | arXiv XML API 实时检索 + 中文关键词双引号英文学术词提取 | |
| 高维向量化 RAG 索引 | `SimpleRAGTool` | 通义 `text-embedding-v3` 1024维 + 余弦相似度 + 7:3 混合排序 | |
| 科学假设生成 | `HypothesisGeneratorSkill` | 归纳-演绎双轨推理 + 流式 Token 输出 + 人类先验反馈注入 | |
| 对抗性审查与逻辑判定 | `HypothesisCriticSkill` | 50分制 Reviewer #2 五维对抗打分 + 流式审查 + 裁决反馈 | |
| 标准 10 字段研究计划报告 | `ResearchPlanWriterSkill` | 自动生成标准的学术 Markdown 研究计划报告 + 动态下载 | |
| 知识图谱实体抽取 | `KnowledgeGraphTool` | LLM 驱动 NER/RE → NetworkX 有向图 → Mermaid 导出 | |
| 人在回路交互控制台 | Streamlit 前端 (`app.py`) | 渐进式卡片 + 暗黑终端 + 大模型对话流 + 结果卡片面板 | |
| 全自动无人值守发现流 | `AIScientistEngine` | Generator 事件流架构 + 多轮闭环 + 实时状态推送 | |
---
## 四、核心 Skill 开发与工程实现(含源代码)
### Skill 1`LiteratureMiningSkill`(文献深度挖掘与 RAG 向量化索引)
结合 `ArxivTool` 进行 arXiv 实时检索,同时自动触发 `SimpleRAGTool` 的 1024 维高维向量化 Embedding 索引构建。支持 `cs.AI``astro-ph``quant-ph``bio` 四大领域分类,检索篇数可在 1-20 篇间灵活调配。`ArxivTool` 内置中文科研问题 → 英文精准学术关键词的智能映射词典,支持双引号精确短语匹配。
```python
class LiteratureMiningSkill:
"""Skill 1: 文献深度挖掘与检索 — arXiv 在线检索 + 通义 1024 维向量化 RAG"""
def __init__(self, rag_tool: SimpleRAGTool = None):
self.rag = rag_tool or SimpleRAGTool()
"""Skill 1: 文献深度挖掘与检索 — arXiv 在线检索 + 通义 1024 维向量化 RAG"""
def __init__(self, rag_tool: SimpleRAGTool = None):
self.rag = rag_tool or SimpleRAGTool()
def execute(self, problem_statement: str, category: str = "cs.AI", max_results: int = 5):
# 1. 在线检索 arXiv 真实论文 (精准双引号学术关键词提取)
online_papers = ArxivTool.search_papers(query=problem_statement, max_results=max_results, category=category)
# 2. 将论文添加至本地 RAG,自动计算 1024 维 Dense Vector Embeddings
self.rag.add_papers(online_papers)
# 3. 提取最具相关性的段落上下文 (7:3 稠密-稀疏混合排序)
relevant_chunks = self.rag.search(query=problem_statement, top_k=max_results, min_score=min_relevance_score)
return {"papers_found": online_papers, "relevant_chunks": relevant_chunks}
```
### Skill 2`HypothesisGeneratorSkill`(科学假说生成器 — 流式输出)
基于 RAG 检索到的真实文献,采用"归纳-演绎"双轨逻辑推理生成 3 组候选假说,每组包含假说陈述、理论推理、支撑证据链、可证伪条件与新颖性自评。支持流式 Token 逐字生成与人类先验反馈注入(审稿人上轮批评意见与导师指导均可在 Prompt 中无缝合并)。
```python
class HypothesisGeneratorSkill:
"""Skill 2: 科学假设生成器 — 归纳-演绎双轨推理 + 流式 Token 输出"""
def execute_stream(self, problem: str, papers: list, critic_feedback: str = ""):
# 组装专业化 Prompt: 注入文献上下文 + 审稿人反馈 + 人类导师先验指导
# 调用 LLMClient.chat_completion_stream() 流式返回结构化 JSON
yield token_chunk # 逐 Token 流式推送至前端暗黑终端与对话视窗
```
### Skill 3`HypothesisCriticSkill`Reviewer #2 对抗性审查 — 流式打分)
系统内置"魔鬼审稿人 Reviewer #2"设定(Prompt 温度设为 0.2 以确保严苛一致性),从 5 大维度进行量化打分(满分 50 分):
| 维度 | 审查标准 | 分值 |
|:---|:---|:---:|
| 逻辑自洽性 (Logical Consistency) | 推理链条是否存在逻辑跳跃或循环论证? | 0-10 |
| 文献支撑度 (Literature Grounding) | 引用的 arXiv 证据是否真实支撑假说? | 0-10 |
| 可证伪性 (Falsifiability) | 是否可以通过实验被证伪(波普尔标准)? | 0-10 |
| 新颖性 (Novelty) | 是否超越现有的 Baseline | 0-10 |
| 实验可行性 (Feasibility) | 验证手段在现有技术条件下是否可实现? | 0-10 |
> **特别优化:物理时间线锚定(Time Anchoring**
> 为了解决大模型对外部挂载最新文献(如 2026 年成果)引发的“白熊效应”或误判为“未来虚构文献”,系统在审稿人系统提示词中强制注入了物理时间线锚定指令。要求模型将自身世界观对齐至真实时间,从而毫无保留地接纳实时检索返回的最前沿学术文献,彻底消除因为知识库截断引起的幻觉误报。
根据总分与配置门槛自动裁决(通过门槛 $T_{pass}$ 侧边栏 20-45 分动态可调,默认 35 分):
- **`ACCEPT` (≥ $T_{pass}$ 分,默认 35分)**:通过审查,进入报告生成阶段;
- **`REVISE` ($T_{pass}-10$ ~ $T_{pass}-1$分)**:退回假说生成器,注入审稿批评意见重新生成;
- **`REJECT` (< $T_{pass}-10$ 分)**:驳回假说,重新检索文献生成新思路。
审查结果以结构化 JSON 返回,前端实时渲染为五维 Metric 仪表盘与判定 Badge。
### Skill 4`ResearchPlanWriterSkill`(研究计划报告撰写器)
严格按照 10 个标准规范字段输出学术研究计划报告:
1. **待研究问题 (Problem Statement)** — 阐述领域痛点与理论空白
2. **解决思路与假说 (Rationale)** — 展开科学假设与证据链路图(Mermaid 格式)
3. **必要技术手段 (Technical Details)** — 具体算法、框架、硬件
4. **数据集 (Datasets)** — Source + Target 数据集描述
5. **论文标题 (Paper Title)** — 自动生成高水平英文学术论文标题
6. **摘要 (Paper Abstract)** — 规范学术摘要(含背景、假说、方法、预期贡献)
7. **方法论 (Methods)** — 含模型架构图(Mermaid 格式)
8. **实验设计 (Experiments)** — Baselines + 消融实验 + 评估指标
9. **预期实验结果 (Expected Results)** — 定量指标与物理图像预测
10. **参考论文 (References)** — 包含 arXiv 真实 DOI
---
## 五、真实案例:端到端科研发现流程演示
### 5.1 问题输入(默认示范案例)
```
如何突破大语言模型在多步复杂科学推理中的逻辑幻觉问题,
并构建具备自一致性(Self-Consistency)校验能力的自进化多智能体科研发现闭环?
```
### 5.2 全自动发现流执行过程
引擎自动执行以下阶段,每阶段均以 Generator 事件流实时推送至前端:
| 阶段 | 引擎操作 | 产出 |
|:---|:---|:---|
| **Stage 1: 文献挖掘** | 向 arXiv `cs.AI` 检索,提取 5 篇真实论文,构建 1024 维 Embedding 索引 | 论文列表(含标题、DOI、发表日期) |
| **Stage 2: 知识图谱** | LLM 驱动 NER/RE 从摘要中抽取实体-关系三元组,构建 NetworkX 图 | Mermaid 知识图谱代码 |
| **Stage 3: 假说生成** | 流式调用 Qwen 大模型,基于文献上下文进行归纳-演绎推理 | 3 组结构化科学假说 (JSON) |
| **Stage 3: 对抗审查** | Reviewer #2 流式审查,返回五维打分 + 裁决 + 详细批注 | ACCEPT/REVISE/REJECT 判定 |
| *(若 REVISE)* | *审稿意见自动注入 Prompt,重新生成假说(最多 N 轮,1-10 轮在前端及引擎可配置)* | *进化后的新假说* |
| **Stage 4: 报告编纂** | 基于最终通过的假说,生成 10 字段标准研究计划 | Markdown 格式研究计划报告 |
### 5.3 生成结果规范
最终产出的《科学假设与研究计划》满足系统规范,包含:
- 中文研究课题主标题
- 10 个一级标题段落,含 Mermaid 证据链路图与方法论架构图
- 所有参考文献附带 arXiv 真实 DOI 链接
- 支持 Markdown 文件一键下载
---
## 六、性能基准测试与对比报告 (Benchmarking)
在完全相同的科学难题下,三大 Qwen 模型生成假说的测速报告如下:
| 模型标识符 (Model ID) | 测试状态 (Status) | 生成总耗时 (Latency) | 假说产出数量 | 速度相对提升 | 适用场景建议 |
| :--- | :--- | :--- | :--- | :--- | :--- |
| **`qwen3.6-flash`** | `SUCCESS (200 OK)` | **`35.46 秒`** | 3 组结构化假说 | **提速 +104%** | **极速实时交互/演示/快速流式预览** |
| **`qwen3.7-plus`** | `SUCCESS (200 OK)` | **`64.09 秒`** | 3 组结构化假说 | Baseline | **日常常规假说探索与平衡模式** |
| **`qwen3.7-max`** | `SUCCESS (200 OK)` | **`72.41 秒`** | 3 组结构化假说 | -13% | **深层复杂推理/最终拟定高水平假设** |
> **说明**:所有模型均通过阿里云百炼 MaaS 平台 OpenAI 兼容 API 调用。前端支持三款模型的实时热切换,用户可根据场景灵活选择速度与推理深度的平衡点。
---
## 七、系统核心算法描述与流程
### 7.1 算法 1:通义 1024 维 Dense Vector 7:3 混合重排检索算法 (Hybrid RAG Algorithm)
#### 1. 算法数学表达
- **稠密向量编码**
给定论文 $D_i$ 的标题与摘要,使用阿里通义 `text-embedding-v3` 模型生成 1024 维高维稠密语义向量:
$$\mathbf{v}_i = \text{Embedding}_{1024}(\text{Title}_i \parallel \text{Summary}_i) \in \mathbb{R}^{1024}$$
同理,对输入的科学难题 Query 计算查询向量 $\mathbf{q} = \text{Embedding}_{1024}(Q) \in \mathbb{R}^{1024}$。
- **余弦相似度计算 (Cosine Similarity)**
$$\text{Sim}_{cosine}(\mathbf{q}, \mathbf{v}_i) = \frac{\mathbf{q} \cdot \mathbf{v}_i}{\|\mathbf{q}\|_2 \|\mathbf{v}_i\|_2 + \epsilon}$$
将其由区间 $[-1, 1]$ 规范化映射至 $[0, 1]$ 得分 $S_{dense}$
$$S_{dense}(q, d_i) = \frac{\text{Sim}_{cosine}(\mathbf{q}, \mathbf{v}_i) + 1.0}{2.0}$$
- **稀疏关键词重叠得分 (Sparse Keyword Overlap)**
$$S_{sparse}(q, d_i) = \frac{|T_q \cap T_{d_i}|}{\ln(|T_{d_i}| + 1) + \epsilon}$$
其中 $T_q$ 为 Query 的分词词包,$T_{d_i}$ 为论文的词包。
- **7:3 混合打分重排融合 (Hybrid Score Fusion)**
$$S_{hybrid}(q, d_i) = 0.7 \times S_{dense}(q, d_i) + 0.3 \times S_{sparse}(q, d_i)$$
最终依据 $S_{hybrid}$ 降序排列,提取 Top-$K$ 最相关真实文献段落,从根源上遏制 LLM 幻觉。
#### 2. Hybrid RAG 检索数据流程
```mermaid
graph TD
A["科研难题 Query"] --> B["阿里通义 text-embedding-v3"]
C["arXiv 检索论文集 (Title+Summary)"] --> B
B --> D["查询向量 q (1024维)"]
B --> E["文献矩阵 V (N×1024维)"]
D --> F["NumPy 高维矩阵余弦相似度计算<br/>Sim_cosine(q, V)"]
E --> F
A --> G["稀疏词包求交集 T_q ∩ T_d"]
C --> G
F --> H["稠密语义得分 S_dense (权重 70%)"]
G --> I["稀疏词匹配得分 S_sparse (权重 30%)"]
H --> J["混合得分融合: S_hybrid = 0.7 * S_dense + 0.3 * S_sparse"]
I --> J
J --> K["Top-K 最相关参考文献与段落输出"]
```
---
### 7.2 算法 2:基于 NetworkX + LLM NER/RE 的三元组抽取与知识图谱构建算法
#### 1. 算法逻辑
1. **实体与关系抽取 (NER/RE)**:调用 Qwen 大模型,输入检索文献摘要文本 $\mathcal{T}$,通过约束性 JSON Schema 提取核心科学实体与相互作用关系,输出三元组集合 $\mathcal{K} = \{(s_k, r_k, o_k, e_k)\}_{k=1}^M$,其中 $s_k$ 为源实体,$r_k$ 为关系谓词,$o_k$ 为目标实体,$e_k$ 为简短支撑依据。
2. **拓扑建图 (Graph Construction)**:建立有向图 $G = (V, E)$。对 $\forall (s, r, o) \in \mathcal{K}$,向节点集加入 $s, o \in V$,添加有向边 $(s, o) \in E$ 并在边上绑定属性 $\text{attr}(s, o) = \{ \text{relation}: r, \text{evidence}: e \}$。
3. **Mermaid 可视化转换与前端渲染**:遍历拓扑图边集 $E$,自动将有向边转化为标准的 Mermaid `graph TD` 语法字符串,格式为 `"Subject" -- "Predicate" --> "Object"`。系统内置自定义组件,通过注入 `mermaid.js` 在 Streamlit 前端页面上实现无需外部依赖的原生动态图谱渲染。
#### 2. 知识图谱抽取与转换流程
```mermaid
graph TD
A["文献摘要文本库 (Abstracts)"] --> B["Qwen LLM NER/RE 实体关系抽取 Prompt"]
B --> C["JSON 格式三元组数组: [(Subject, Predicate, Object, Evidence)]"]
C --> D["NetworkX 有向图构图引擎 (DiGraph)"]
D --> E["节点集合 V (Entities) & 有向边集合 E (Relations)"]
E --> F["Mermaid 代码导出器 (to_mermaid)"]
F --> G["标准的 Mermaid graph TD 代码"]
G --> H["报告与 Web 前端交互渲染 (证据链路图)"]
```
---
### 7.3 算法 3Reviewer #2 50分制五维对抗审查与自动裁决算法
#### 1. 评分向量与裁决函数
- **五维量化打分向量**
魔鬼审稿人子智能体对假说 $H$ 从 5 个独立维度进行 1-10 分的打分:
$$\mathbf{S}(H) = \big[s_{lc}, s_{lg}, s_{f}, s_{n}, s_{fe}\big] \in \{1, 2, \dots, 10\}^5$$
- $s_{lc}$: 逻辑自洽性 (Logical Consistency)
- $s_{lg}$: 文献支撑度 (Literature Grounding)
- $s_{f}$: 可证伪性 (Falsifiability)
- $s_{n}$: 理论新颖性 (Novelty)
- $s_{fe}$: 实验可行性 (Feasibility)
- **综合评分**
$$S_{total}(H) = \sum_{m \in \{lc, lg, f, n, fe\}} s_m \quad \in [5, 50]$$
- **判定裁决函数 (Decision Rule)**
$$\text{Decision}(H) = \begin{cases} \mathbf{ACCEPT}, & \text{if } S_{total}(H) \ge 40 \\ \mathbf{REVISE}, & \text{if } 30 \le S_{total}(H) < 40 \\ \mathbf{REJECT}, & \text{if } S_{total}(H) < 30 \end{cases}$$
---
### 7.4 算法 4:自进化迭代闭环控制流程 (Self-Evolution Control Flow)
当同行审查决策为 `REVISE``REJECT` 时,系统自动触发闭环控制流程,将上一轮审稿人的批注细节 `detailed_comments` 转化为下一轮假说生成的上下文约束条件:
$$\text{Prompt}_{gen}^{(t+1)} = \text{Prompt}_{gen}^{(0)} \;\parallel\; \text{Context}_{RAG} \;\parallel\; \text{Feedback}_{rev}^{(t)}$$
控制流程最多进行 $N$ 轮迭代(侧边栏 1-10 轮可调,默认 3 轮),状态转移图如下:
```mermaid
stateDiagram-v2
[*] --> Stage1_LitMining: 输入科学难题 Query
Stage1_LitMining --> Stage2_KG: 获得真实 arXiv 文献
Stage2_KG --> Stage3_HypoGen: 生成 Mermaid 知识图谱
state SelfEvolutionLoop {
Stage3_HypoGen --> Stage3_Critic: 建立 LLM 流式对话推导假说
Stage3_Critic --> DecisionPoint: Reviewer #2 五维对抗打分
state DecisionPoint <<choice>>
DecisionPoint --> AcceptBranch: 得分 >= 40 分 (ACCEPT)
DecisionPoint --> ReviseBranch: 得分 < 40 分 & t < N (REVISE/REJECT)
DecisionPoint --> TimeoutBranch: t >= N (达到最大轮数限制)
ReviseBranch --> Stage3_HypoGen: 注入审稿意见批注 -> t = t + 1
}
AcceptBranch --> Stage4_PlanWriter: 拟定最佳假说
TimeoutBranch --> Stage4_PlanWriter: 选定最高得分假说
Stage4_PlanWriter --> [*]: 输出 10 字段标准研究计划 Markdown
```
---
## 八、部署与运行配置
### 8.1 环境配置文件 (`.env`)
```bash
API_KEY=sk-ws-H.EIEIYRR.aog7.MEYCIQC-4JCaV22ldDMX49afVMImefo_0r9I5WBgfK8u5e7bTQIhANGxw_DQzcZBbIjn9WBC2YeS-cUxxz1XKI8AvOh3G4KP
BASE_URL=https://ws-9jafndj781t370vz.cn-beijing.maas.aliyuncs.com/compatible-mode/v1
DEFAULT_MODEL=qwen3.7-max
```
### 8.2 依赖安装
```bash
pip install -r requirements.txt
```
核心依赖:`openai>=1.0.0``streamlit>=1.30.0``networkx>=3.0``numpy>=1.24.0``requests>=2.28.0`
### 8.3 启动 Web 应用
```bash
streamlit run frontend/app.py --server.port 8501 --server.headless true
```
### 8.4 命令行端到端演示
```bash
python run_paper_example.py
```
> 该脚本将自动执行完整的科研发现流程(文献挖掘 → 知识图谱 → 假说生成 → 对抗审查 → 报告编纂),最终产出的研究计划报告保存至 `outputs/` 目录。
---
## 九、项目目录结构
```
_基于国产开源大模型的AI Scientist的研发与应用/
.env # Qwen MaaS API 密钥与端点配置
.streamlit/
config.toml # Streamlit 质感主题 (Indigo 配色) 与 Deploy 隐藏
-AI_Scientist工程实践方案.md # 本工程技术方案文档
_基于国产开源大模型的AI Scientist的研发与应用.pdf # 系统 PDF 原文
requirements.txt # Python 依赖清单
run_paper_example.py # 命令行端到端论文生成实例脚本
docs/
architecture_diagram.png # 4 层系统架构高清设计图
frontend/
app.py # Streamlit 双模式主应用
# 人在回路协同模式 (渐进式卡片 + 终端日志)
# 全自动一键流模式 (双栏控制台 + 对话视窗 + 结果卡片)
# render_hypothesis_card() 科学假说卡片组件
# render_review_card() 审查打分仪表盘组件
src/
config.py # 系统全局配置 (API 密钥、模型、路径)
agent/
engine.py # AI Scientist 自进化闭环核心引擎
# run_discovery_flow() Generator 事件流架构
llm/
client.py # Qwen 统一 LLM 客户端
# chat_completion() 单次推理
# chat_completion_stream() 流式 Token 生成
# get_embedding() 1024 维 Embedding
# _fallback_request() HTTP 回退兼容
skills/
literature_mining.py # Skill 1: 文献深度挖掘 (arXiv + RAG)
hypothesis_generator.py # Skill 2: 科学假说生成器 (流式 + 反馈注入)
hypothesis_critic.py # Skill 3: Reviewer #2 对抗审查 (流式 + 五维打分)
plan_writer.py # Skill 4: 系统标准 10 字段报告撰写器
tools/
arxiv_tool.py # arXiv XML API 真实学术论文检索工具
graph_tool.py # 知识图谱实体抽取工具 (NetworkX + Mermaid)
rag_tool.py # 1024 维 Dense Vector 余弦相似度 RAG 工具
outputs/ # 生成的研究计划报告 Markdown
latest_research_plan.md # 最新一次运行的报告产出
```
---
## 十、总结与展望
本方案紧扣系统"基于国产开源大模型的 AI Scientist 的研发与应用"的核心要求,以 **全自主多智能体框架 + 阿里通义 Qwen 国产开源大模型** 为技术底座,实现了从真实文献检索、知识图谱构建、科学假说生成、对抗性审查打分到标准研究计划报告自动编纂的**全链路端到端科研发现闭环**。
**核心竞争力**
1. **真正的自进化闭环**Reviewer #2 对抗审查 + 多轮自动迭代(1-10 轮在前端及引擎可配置,默认 3 轮),而非一次性生成的开环工具;
2. **杜绝幻觉的 RAG 底座**:通义 1024 维 Dense Vector + 7:3 混合重排,每条假说可溯源至 arXiv 真实论文;
3. **双模式并行 + 实时可视化**:人在回路与全自动模式并存,大模型对话流式视窗 + 假说/审查卡片实时渲染;
4. **轻量高效集成**:领域 Prompt 工程与 RAG 检索机制协同,显著提升大模型在自然科学推理中的专业度;
5. **一键可复现**`pip install + streamlit run` 即可完整体验。