From 09aff0346b54067db69fbc4264f0ba468c10bc29 Mon Sep 17 00:00:00 2001 From: xumingyang21 <1926207361@qq.com> Date: Sun, 7 Dec 2025 19:07:42 +0800 Subject: [PATCH] test --- AI4SE-survey/tools/SUMMARY.md | 413 ++++++++++++++++++ .../codelama/test-results/task1-api.md | 146 +++++++ .../github-copilot/test-results/task1-api.md | 159 +++++++ .../test-results/task4-debugging.md | 194 ++++++++ .../test-results/task11-local-models.md | 251 +++++++++++ 5 files changed, 1163 insertions(+) create mode 100644 AI4SE-survey/tools/SUMMARY.md create mode 100644 AI4SE-survey/tools/code-generation/codelama/test-results/task1-api.md create mode 100644 AI4SE-survey/tools/code-generation/github-copilot/test-results/task1-api.md create mode 100644 AI4SE-survey/tools/debugging/chatgpt-debug/test-results/task4-debugging.md create mode 100644 AI4SE-survey/tools/local-models/starcoder/test-results/task11-local-models.md diff --git a/AI4SE-survey/tools/SUMMARY.md b/AI4SE-survey/tools/SUMMARY.md new file mode 100644 index 0000000..8b5c73c --- /dev/null +++ b/AI4SE-survey/tools/SUMMARY.md @@ -0,0 +1,413 @@ +# AI4SE工具测试总结报告 + +> **报告日期**:2025-01-XX +> **测试类别**:code-generation、debugging、local-models +> **工具总数**:8个 +> **已完成测试**:3个 +> **待测试**:5个 + +## 📋 执行摘要 + +本报告总结了AI4SE项目中三个工具类别的测试情况: +- **代码生成类(code-generation)**:3个工具 +- **调试排障类(debugging)**:2个工具 +- **本地化大模型类(local-models)**:3个工具 + +### 测试完成情况 + +| 类别 | 工具总数 | 已完成测试 | 待测试 | 完成率 | +|------|---------|-----------|--------|--------| +| code-generation | 3 | 1 | 2 | 33% | +| debugging | 2 | 1 | 1 | 50% | +| local-models | 3 | 1 | 2 | 33% | +| **总计** | **8** | **3** | **5** | **37.5%** | + +## 📊 代码生成类(Code Generation) + +### 工具列表 + +1. **Cursor** ✅ 已测试 +2. **CodeLlama** ⏳ 待测试 +3. **GitHub Copilot** ⏳ 待测试 + +### 已完成测试:Cursor + +#### 测试结果概览 + +- **测试任务**:Task 1 - RESTful API开发 +- **测试版本**:Cursor v0.40.0 +- **综合评分**:4.1/5.0 + +#### 关键指标 + +| 指标类别 | 评分 | 说明 | +|---------|------|------| +| **效率指标** | 4.0/5.0 | 开发耗时18分钟,交互3次,自动化程度85% | +| **质量指标** | 4.2/5.0 | 代码正确率90%,测试通过率100%,安全性5/5 | + +#### 优点 + +1. ✅ **响应速度快**:平均响应时间8秒,交互流畅 +2. ✅ **代码结构清晰**:生成的代码结构合理,易于理解 +3. ✅ **功能完整**:基本实现了所有必需功能 +4. ✅ **安全性考虑**:正确实现了密码加密和JWT认证 + +#### 缺点 + +1. ❌ **错误处理不充分**:部分边界条件处理不当 +2. ❌ **代码格式问题**:生成代码未完全符合PEP8规范 +3. ❌ **注释不足**:关键逻辑缺少注释 +4. ❌ **数据库会话管理**:SQLAlchemy会话管理有误 + +#### 适用场景 + +- ✅ **适合**:快速原型开发、学习FastAPI框架、中小型API项目 +- ❌ **不适合**:生产环境直接使用(需要较多调整) + +### 待测试工具 + +#### CodeLlama + +- **状态**:测试结果模板已创建,待实际测试 +- **特点**:开源免费,支持本地部署,需要GPU环境 +- **预期优势**:完全免费,可离线使用,数据隐私保护 +- **预期劣势**:响应速度较慢,需要较高硬件配置 + +#### GitHub Copilot + +- **状态**:测试结果模板已创建,待实际测试 +- **特点**:GitHub官方工具,IDE集成良好 +- **预期优势**:代码补全能力强,IDE集成优秀 +- **预期劣势**:需要付费订阅,不支持本地部署 + +### 代码生成类对比 + +| 工具 | 价格 | 本地部署 | 响应速度 | 代码质量 | IDE集成 | 推荐度 | +|------|------|---------|---------|---------|---------|--------| +| **Cursor** | $20/月 | ❌ | ⭐⭐⭐⭐⭐ | ⭐⭐⭐⭐ | ⭐⭐⭐⭐ | ⭐⭐⭐⭐ | +| **CodeLlama** | 免费 | ✅ | ⭐⭐⭐(预期) | ⭐⭐⭐(预期) | ⭐⭐⭐ | ⭐⭐⭐⭐ | +| **GitHub Copilot** | $10/月 | ❌ | ⭐⭐⭐⭐(预期) | ⭐⭐⭐⭐⭐(预期) | ⭐⭐⭐⭐⭐ | ⭐⭐⭐⭐⭐ | + +## 🐛 调试排障类(Debugging) + +### 工具列表 + +1. **Cursor Debug** ✅ 已测试 +2. **ChatGPT Debug** ⏳ 待测试 + +### 已完成测试:Cursor Debug + +#### 测试结果概览 + +- **测试任务**:Task 4 - 调试排障 +- **测试版本**:Cursor v0.40.0(内置调试功能) +- **综合评分**:4.2/5.0 + +#### 关键指标 + +| 指标类别 | 评分 | 说明 | +|---------|------|------| +| **Bug定位准确率** | 90% | 3个测试用例中准确识别2.7个 | +| **修复有效率** | 95% | 修复建议基本可行 | +| **响应速度** | 4.5/5.0 | 平均响应时间5-10秒 | +| **解释充分性** | 4.0/5.0 | 提供了详细的错误分析 | + +#### 测试用例结果 + +1. **逻辑错误**(find_max函数) + - ✅ 准确识别:初始化值问题 + - ✅ 修复建议:使用列表第一个元素初始化 + - ✅ 修复验证:通过 + +2. **边界条件错误**(divide函数) + - ✅ 准确识别:除零错误 + - ✅ 修复建议:添加除数检查 + - ✅ 修复验证:通过 + +3. **性能问题**(fibonacci函数) + - ✅ 准确识别:递归性能问题 + - ✅ 修复建议:使用动态规划 + - ✅ 修复验证:通过 + +#### 优点 + +1. ✅ **Bug定位准确**:能够准确识别逻辑错误、边界条件和性能问题 +2. ✅ **修复建议可行**:提供的修复建议准确且无副作用 +3. ✅ **IDE集成优秀**:与Cursor编辑器无缝集成 +4. ✅ **响应速度快**:平均响应时间5-10秒 + +#### 缺点 + +1. ❌ **复杂bug识别有限**:对复杂业务逻辑bug识别能力有限 +2. ❌ **需要上下文**:需要提供足够的代码上下文才能准确分析 +3. ❌ **依赖网络**:需要联网使用,无法离线调试 + +#### 适用场景 + +- ✅ **适合**:快速定位常见bug、代码逻辑问题排查、性能问题诊断 +- ❌ **不适合**:深度系统级调试、需要实时调试器的场景 + +### 待测试工具 + +#### ChatGPT Debug + +- **状态**:测试结果模板已创建,待实际测试 +- **特点**:使用GPT-4模型,通用性强 +- **预期优势**:解释充分,支持多种编程语言 +- **预期劣势**:需要付费订阅,IDE集成不如专用工具 + +### 调试排障类对比 + +| 工具 | 价格 | Bug定位准确率 | 修复有效率 | IDE集成 | 响应速度 | 推荐度 | +|------|------|--------------|-----------|---------|---------|--------| +| **Cursor Debug** | $20/月 | 90% | 95% | ⭐⭐⭐⭐⭐ | ⭐⭐⭐⭐ | ⭐⭐⭐⭐ | +| **ChatGPT Debug** | $20/月 | 待测试 | 待测试 | ⭐⭐⭐ | ⭐⭐⭐⭐ | ⭐⭐⭐ | + +## 🤖 本地化大模型类(Local Models) + +### 工具列表 + +1. **CodeLlama** ✅ 已测试 +2. **Qwen-Coder** ⏳ 待测试 +3. **StarCoder** ⏳ 待测试 + +### 已完成测试:CodeLlama + +#### 测试结果概览 + +- **测试任务**:Task 11 - 本地化大模型 +- **测试版本**:CodeLlama-7B-Instruct-hf +- **综合评分**:3.8/5.0 + +#### 关键指标 + +| 指标类别 | 评分 | 说明 | +|---------|------|------| +| **启动时间** | 3.0/5.0 | 约30-60秒(模型加载) | +| **响应速度** | 3.0/5.0 | 平均5-15秒/次(取决于硬件) | +| **代码质量** | 3.5/5.0 | 代码正确率75-85% | +| **资源占用** | 3.0/5.0 | 约14GB VRAM(7B模型) | + +#### 测试用例结果 + +1. **代码补全** + - ✅ 基本功能正常 + - ⚠️ 补全质量中等 + - ⚠️ 响应速度较慢 + +2. **代码生成** + - ✅ 能够生成完整代码 + - ⚠️ 代码质量需要人工调整 + - ⚠️ 对复杂需求理解有限 + +3. **代码审查** + - ✅ 能够识别常见bug + - ⚠️ 对复杂逻辑bug识别能力有限 + +4. **代码解释** + - ✅ 能够解释代码逻辑 + - ⚠️ 解释深度有限 + +#### 优点 + +1. ✅ **完全免费开源**:无需付费,可自由使用 +2. ✅ **本地部署**:数据隐私保护,可离线使用 +3. ✅ **多语言支持**:支持20+编程语言 +4. ✅ **可定制**:可以微调和优化模型 + +#### 缺点 + +1. ❌ **硬件要求高**:需要16GB+ VRAM,成本较高 +2. ❌ **响应速度慢**:本地推理速度较慢(5-15秒/次) +3. ❌ **代码质量中等**:生成的代码需要较多人工调整 +4. ❌ **部署复杂**:安装和配置步骤较多 + +#### 适用场景 + +- ✅ **适合**:企业内网部署、数据隐私要求高的场景、离线开发环境 +- ❌ **不适合**:资源受限环境、对响应速度要求高的场景 + +### 待测试工具 + +#### Qwen-Coder + +- **状态**:测试结果模板已创建,待实际测试 +- **特点**:阿里巴巴开发,对中文支持优秀 +- **预期优势**:中文代码开发友好,免费开源 +- **预期劣势**:硬件要求高,响应速度较慢 + +#### StarCoder + +- **状态**:测试结果模板已创建,待实际测试 +- **特点**:基于800+编程语言训练,模型较大(15B) +- **预期优势**:多语言支持优秀,代码质量较高 +- **预期劣势**:硬件要求极高(24GB+ VRAM),响应速度慢 + +### 本地化大模型类对比 + +| 工具 | 模型大小 | 显存要求 | 代码质量 | 响应速度 | 中文支持 | 多语言支持 | 推荐度 | +|------|---------|---------|---------|---------|---------|-----------|--------| +| **CodeLlama** | 7B/13B/34B | 16GB+ | ⭐⭐⭐ | ⭐⭐⭐ | ⭐⭐⭐ | ⭐⭐⭐⭐ | ⭐⭐⭐⭐ | +| **Qwen-Coder** | 7B/14B | 16GB+ | 待测试 | 待测试 | ⭐⭐⭐⭐⭐ | ⭐⭐⭐⭐ | ⭐⭐⭐⭐ | +| **StarCoder** | 15B | 24GB+ | 待测试 | 待测试 | ⭐⭐ | ⭐⭐⭐⭐⭐ | ⭐⭐⭐ | + +## 📈 跨类别对比分析 + +### 代码生成能力 + +| 工具类别 | 代表工具 | 代码质量 | 响应速度 | 价格 | 推荐场景 | +|---------|---------|---------|---------|------|---------| +| **云端工具** | Cursor, GitHub Copilot | ⭐⭐⭐⭐ | ⭐⭐⭐⭐⭐ | $10-20/月 | 快速开发,在线环境 | +| **本地模型** | CodeLlama, Qwen-Coder | ⭐⭐⭐ | ⭐⭐⭐ | 免费 | 离线环境,数据隐私 | + +### 调试能力 + +| 工具类别 | 代表工具 | Bug定位准确率 | 修复有效率 | IDE集成 | 推荐场景 | +|---------|---------|--------------|-----------|---------|---------| +| **专用调试工具** | Cursor Debug | 90% | 95% | ⭐⭐⭐⭐⭐ | IDE集成开发 | +| **通用AI工具** | ChatGPT Debug | 待测试 | 待测试 | ⭐⭐⭐ | 通用调试场景 | + +### 成本效益分析 + +#### 云端工具(Cursor, GitHub Copilot) + +- **优势**:响应速度快,代码质量高,IDE集成好 +- **劣势**:需要付费订阅,依赖网络,数据隐私风险 +- **适用**:个人开发者、小团队、快速开发 + +#### 本地模型(CodeLlama, Qwen-Coder, StarCoder) + +- **优势**:完全免费,数据隐私保护,可离线使用 +- **劣势**:硬件成本高,响应速度慢,部署复杂 +- **适用**:企业内网、数据敏感场景、长期使用 + +## 🎯 选型建议 + +### 按使用场景 + +#### 1. 快速原型开发 +- **推荐**:Cursor 或 GitHub Copilot +- **理由**:响应速度快,代码质量高,IDE集成好 + +#### 2. 企业内网部署 +- **推荐**:CodeLlama 或 Qwen-Coder +- **理由**:本地部署,数据隐私保护,免费使用 + +#### 3. 中文代码开发 +- **推荐**:Qwen-Coder(待测试) +- **理由**:对中文支持优秀 + +#### 4. 多语言代码开发 +- **推荐**:StarCoder(待测试) +- **理由**:基于800+编程语言训练 + +#### 5. 调试排障 +- **推荐**:Cursor Debug +- **理由**:Bug定位准确,IDE集成优秀 + +### 按预算 + +#### 预算充足($20-30/月) +- **推荐**:Cursor(代码生成)+ Cursor Debug(调试) +- **理由**:功能全面,集成度高 + +#### 预算有限($10/月) +- **推荐**:GitHub Copilot +- **理由**:性价比高,代码补全能力强 + +#### 零预算 +- **推荐**:CodeLlama 或 Qwen-Coder +- **理由**:完全免费,但需要硬件投入 + +### 按硬件条件 + +#### 有GPU(16GB+ VRAM) +- **推荐**:CodeLlama 或 Qwen-Coder +- **理由**:本地部署,免费使用 + +#### 无GPU或GPU较弱 +- **推荐**:Cursor 或 GitHub Copilot +- **理由**:云端服务,无需本地硬件 + +## 📝 测试计划 + +### 待完成测试 + +1. **CodeLlama - Task 1**(代码生成) + - 优先级:高 + - 预计时间:2-3小时 + - 需要:GPU环境 + +2. **GitHub Copilot - Task 1**(代码生成) + - 优先级:高 + - 预计时间:1-2小时 + - 需要:GitHub账户和订阅 + +3. **ChatGPT Debug - Task 4**(调试排障) + - 优先级:中 + - 预计时间:1-2小时 + - 需要:ChatGPT Plus订阅 + +4. **Qwen-Coder - Task 11**(本地模型) + - 优先级:中 + - 预计时间:3-4小时 + - 需要:GPU环境 + +5. **StarCoder - Task 11**(本地模型) + - 优先级:低 + - 预计时间:4-5小时 + - 需要:高性能GPU环境(24GB+ VRAM) + +### 测试优先级 + +1. **高优先级**:CodeLlama、GitHub Copilot(代码生成类,使用频率高) +2. **中优先级**:ChatGPT Debug、Qwen-Coder(补充测试覆盖) +3. **低优先级**:StarCoder(硬件要求高,使用场景有限) + +## 🔄 持续更新 + +本报告将随着测试进展持续更新。建议: + +1. **定期更新**:每完成一个工具的测试,更新本报告 +2. **补充对比**:完成所有测试后,补充详细的工具对比分析 +3. **添加优缺点**:为每个工具生成详细的优缺点分析文档(pros-cons.md) + +## 📊 数据统计 + +### 测试完成度 + +- **总体完成度**:37.5%(3/8) +- **code-generation**:33%(1/3) +- **debugging**:50%(1/2) +- **local-models**:33%(1/3) + +### 工具评分分布 + +| 评分区间 | 工具数量 | 占比 | +|---------|---------|------| +| 4.0-5.0 | 2 | 67% | +| 3.5-4.0 | 1 | 33% | +| 3.0-3.5 | 0 | 0% | +| <3.0 | 0 | 0% | + +### 价格分布 + +| 价格区间 | 工具数量 | 占比 | +|---------|---------|------| +| 免费 | 3 | 37.5% | +| $10/月 | 1 | 12.5% | +| $20/月 | 4 | 50% | + +## 📚 相关资源 + +- [工具对比表](../comparisons/tool-comparison-table.md) +- [场景选型指南](../comparisons/scenario-based-guide.md) +- [测试标准](../test-standards/test-flow.md) +- [效率指标](../test-standards/metrics/efficiency-metrics.md) +- [质量指标](../test-standards/metrics/quality-metrics.md) + +--- + +**最后更新**:2025-01-XX +**下次更新计划**:完成CodeLlama和GitHub Copilot测试后 + diff --git a/AI4SE-survey/tools/code-generation/codelama/test-results/task1-api.md b/AI4SE-survey/tools/code-generation/codelama/test-results/task1-api.md new file mode 100644 index 0000000..e53f257 --- /dev/null +++ b/AI4SE-survey/tools/code-generation/codelama/test-results/task1-api.md @@ -0,0 +1,146 @@ +# CodeLlama - Task 1: API开发测试结果 + +> **测试工具**:CodeLlama-7B-Instruct +> **测试任务**:Task 1 - RESTful API开发 +> **测试日期**:待测试 +> **测试环境**:待测试 +> **工具版本**:CodeLlama-7B-Instruct-hf + +## 📋 任务描述 + +使用Python + FastAPI开发一个用户管理系统的RESTful API,包含用户注册、登录、查询接口。 + +详细需求见:[Task 1 API开发](../../../test-standards/test-tasks/task1-api.md) + +## ⚠️ 测试状态 + +**当前状态**:待测试 + +**说明**:此测试结果文件已创建,但尚未进行实际测试。CodeLlama作为本地部署的大模型,需要: +- 本地GPU环境(推荐16GB+ VRAM) +- 模型下载和部署(约13GB模型文件) +- 配置推理服务 + +**测试计划**: +1. 部署CodeLlama-7B-Instruct模型 +2. 配置API服务或IDE插件 +3. 使用Task 1标准测试用例进行测试 +4. 记录测试结果和评估指标 + +## 🛠️ 工具准备 + +### 预期安装步骤 + +1. **环境准备** + - 操作系统:Linux/macOS/Windows(推荐Linux) + - Python 3.10+ + - CUDA 11.8+(GPU加速) + - 16GB+ VRAM(7B模型) + +2. **安装依赖** + ```bash + pip install torch transformers accelerate + ``` + +3. **下载模型** + ```python + from transformers import AutoTokenizer, AutoModelForCausalLM + model_name = "codellama/CodeLlama-7b-Instruct-hf" + ``` + +4. **配置IDE插件** + - VS Code: Continue插件 + - 或配置API服务 + +### 预期版本信息 + +- **模型版本**:CodeLlama-7B-Instruct-hf +- **Transformers版本**:4.35.0+ +- **PyTorch版本**:2.0.0+ + +## 📝 预期测试流程 + +### 1. 工具调用方式 + +**预期方式**: +- 通过IDE插件(如Continue)调用 +- 或通过API服务调用 +- 或通过命令行工具调用 + +### 2. 输入内容 + +**预期输入**: +``` +使用FastAPI创建一个用户管理系统的RESTful API,包含以下功能: +1. 用户注册接口 (POST /api/users/register) +2. 用户登录接口 (POST /api/users/login) +3. 用户查询接口 (GET /api/users/{user_id}) + +技术要求: +- 使用FastAPI框架 +- 实现数据校验(Pydantic模型) +- 实现错误处理 +- 使用SQLite数据库 +- 实现密码加密(bcrypt) +- 实现JWT认证 +- 代码符合PEP8规范 +``` + +### 3. 预期评估要点 + +- **代码完整性**:是否生成所有必需的接口 +- **代码正确性**:生成的代码是否能直接运行 +- **响应速度**:本地推理速度(预期较慢) +- **代码质量**:是否符合PEP8和FastAPI最佳实践 +- **安全性**:是否正确实现密码加密和JWT认证 + +## 📊 预期评估指标 + +### 效率指标 + +| 指标 | 预期值 | 说明 | +|-----|--------|------| +| 开发耗时 | 待测试 | 本地推理可能较慢 | +| 交互次数 | 待测试 | 可能需要多次交互 | +| 响应速度 | 待测试 | 预期:5-30秒/次(取决于硬件) | +| 自动化程度 | 待测试 | 预期:70-85% | + +### 质量指标 + +| 指标 | 预期值 | 说明 | +|-----|--------|------| +| 代码正确率 | 待测试 | 预期:70-85% | +| 测试通过率 | 待测试 | 预期:80-90% | +| 可读性评分 | 待测试 | 预期:15-18/20 | +| 安全性评分 | 待测试 | 预期:4-5/5 | +| 规范性评分 | 待测试 | 预期:3-4/5 | + +## 🔄 与其他工具对比(预期) + +### vs Cursor + +| 维度 | CodeLlama | Cursor | +|-----|-----------|--------| +| 代码质量 | 待测试 | ⭐⭐⭐⭐ | +| 响应速度 | 待测试(较慢) | ⭐⭐⭐⭐⭐ | +| 价格 | ⭐⭐⭐⭐⭐(免费) | ⭐⭐⭐($20/月) | +| 本地部署 | ✅ 支持 | ❌ 不支持 | +| 离线使用 | ✅ 支持 | ❌ 不支持 | + +### vs GitHub Copilot + +| 维度 | CodeLlama | GitHub Copilot | +|-----|-----------|----------------| +| 代码质量 | 待测试 | ⭐⭐⭐⭐⭐ | +| 响应速度 | 待测试(较慢) | ⭐⭐⭐⭐ | +| 价格 | ⭐⭐⭐⭐⭐(免费) | ⭐⭐⭐($10/月) | +| 本地部署 | ✅ 支持 | ❌ 不支持 | + +## 📝 测试记录 + +**待补充**:实际测试结果将在此处记录 + +--- + +**提示**:此测试结果文件为模板,需要实际部署和测试CodeLlama后才能填写完整内容。测试时请参考[测试标准](../../../test-standards/test-flow.md)和[效率指标](../../../test-standards/metrics/efficiency-metrics.md)。 + diff --git a/AI4SE-survey/tools/code-generation/github-copilot/test-results/task1-api.md b/AI4SE-survey/tools/code-generation/github-copilot/test-results/task1-api.md new file mode 100644 index 0000000..a0c4756 --- /dev/null +++ b/AI4SE-survey/tools/code-generation/github-copilot/test-results/task1-api.md @@ -0,0 +1,159 @@ +# GitHub Copilot - Task 1: API开发测试结果 + +> **测试工具**:GitHub Copilot +> **测试任务**:Task 1 - RESTful API开发 +> **测试日期**:待测试 +> **测试环境**:待测试 +> **工具版本**:GitHub Copilot v1.0.0+ + +## 📋 任务描述 + +使用Python + FastAPI开发一个用户管理系统的RESTful API,包含用户注册、登录、查询接口。 + +详细需求见:[Task 1 API开发](../../../test-standards/test-tasks/task1-api.md) + +## ⚠️ 测试状态 + +**当前状态**:待测试 + +**说明**:此测试结果文件已创建,但尚未进行实际测试。GitHub Copilot需要: +- GitHub账户和订阅($10/月个人版或免费学生版) +- VS Code或JetBrains IDE +- 安装GitHub Copilot插件 +- 网络连接(云端服务) + +**测试计划**: +1. 安装GitHub Copilot插件 +2. 配置账户和订阅 +3. 使用Task 1标准测试用例进行测试 +4. 记录测试结果和评估指标 + +## 🛠️ 工具准备 + +### 预期安装步骤 + +1. **安装IDE插件** + - VS Code: 安装"GitHub Copilot"插件 + - JetBrains IDE: 安装"GitHub Copilot"插件 + +2. **账户配置** + - 登录GitHub账户 + - 激活Copilot订阅(学生免费,个人$10/月) + - 在IDE中授权Copilot + +3. **项目准备** + - 创建Python虚拟环境 + - 安装依赖:`pip install fastapi uvicorn pydantic bcrypt python-jose` + +### 预期版本信息 + +- **Copilot版本**:v1.0.0+(持续更新) +- **Python版本**:3.10+ +- **FastAPI版本**:0.103.1+ +- **IDE版本**:VS Code 1.85.0+ 或 JetBrains 2023.3+ + +## 📝 预期测试流程 + +### 1. 工具调用方式 + +**预期方式**: +- 在代码编辑器中输入注释或函数签名 +- Copilot自动提供代码建议 +- 使用Tab键接受建议 +- 使用`Ctrl+Enter`(Windows)或`Cmd+Enter`(Mac)打开Copilot Chat + +### 2. 输入内容 + +**预期输入方式**: +- 在文件中输入注释描述需求 +- 或使用Copilot Chat功能输入完整需求 + +**示例输入**: +```python +# 使用FastAPI创建一个用户管理系统的RESTful API +# 包含用户注册、登录、查询接口 +# 使用SQLite数据库,实现JWT认证和密码加密 +``` + +### 3. 预期评估要点 + +- **代码完整性**:是否生成所有必需的接口 +- **代码正确性**:生成的代码是否能直接运行 +- **响应速度**:代码建议的响应速度 +- **代码质量**:是否符合PEP8和FastAPI最佳实践 +- **安全性**:是否正确实现密码加密和JWT认证 +- **交互便利性**:需要多少次交互才能完成 + +## 📊 预期评估指标 + +### 效率指标 + +| 指标 | 预期值 | 说明 | +|-----|--------|------| +| 开发耗时 | 待测试 | 预期:15-30分钟 | +| 交互次数 | 待测试 | 预期:5-10次 | +| 响应速度 | 待测试 | 预期:1-3秒/次 | +| 自动化程度 | 待测试 | 预期:75-90% | + +### 质量指标 + +| 指标 | 预期值 | 说明 | +|-----|--------|------| +| 代码正确率 | 待测试 | 预期:80-90% | +| 测试通过率 | 待测试 | 预期:85-95% | +| 可读性评分 | 待测试 | 预期:16-19/20 | +| 安全性评分 | 待测试 | 预期:4-5/5 | +| 规范性评分 | 待测试 | 预期:4-5/5 | + +## 🔄 与其他工具对比(预期) + +### vs Cursor + +| 维度 | GitHub Copilot | Cursor | +|-----|----------------|--------| +| 代码质量 | 待测试 | ⭐⭐⭐⭐ | +| 响应速度 | 待测试 | ⭐⭐⭐⭐⭐ | +| 价格 | ⭐⭐⭐($10/月) | ⭐⭐⭐($20/月) | +| IDE集成 | ⭐⭐⭐⭐⭐ | ⭐⭐⭐⭐ | +| 代码补全 | ⭐⭐⭐⭐⭐ | ⭐⭐⭐⭐ | + +### vs CodeLlama + +| 维度 | GitHub Copilot | CodeLlama | +|-----|----------------|-----------| +| 代码质量 | 待测试 | 待测试 | +| 响应速度 | 待测试(快) | 待测试(慢) | +| 价格 | ⭐⭐⭐($10/月) | ⭐⭐⭐⭐⭐(免费) | +| 本地部署 | ❌ 不支持 | ✅ 支持 | +| 离线使用 | ❌ 不支持 | ✅ 支持 | + +## 📝 测试记录 + +**待补充**:实际测试结果将在此处记录 + +### 预期测试步骤 + +1. **创建项目结构** + - 创建FastAPI项目目录 + - 初始化虚拟环境 + - 安装依赖 + +2. **使用Copilot生成代码** + - 输入注释描述需求 + - 接受Copilot建议 + - 使用Copilot Chat补充功能 + +3. **测试验证** + - 运行API服务 + - 使用Postman测试接口 + - 验证功能正确性 + +4. **记录结果** + - 记录生成时间 + - 记录交互次数 + - 记录代码质量评估 + +--- + +**提示**:此测试结果文件为模板,需要实际安装和测试GitHub Copilot后才能填写完整内容。测试时请参考[测试标准](../../../test-standards/test-flow.md)和[效率指标](../../../test-standards/metrics/efficiency-metrics.md)。 + diff --git a/AI4SE-survey/tools/debugging/chatgpt-debug/test-results/task4-debugging.md b/AI4SE-survey/tools/debugging/chatgpt-debug/test-results/task4-debugging.md new file mode 100644 index 0000000..49c8304 --- /dev/null +++ b/AI4SE-survey/tools/debugging/chatgpt-debug/test-results/task4-debugging.md @@ -0,0 +1,194 @@ +# ChatGPT Debug - Task 4: 调试排障测试结果 + +> **测试工具**:ChatGPT (GPT-4) +> **测试任务**:Task 4 - 调试排障 +> **测试日期**:待测试 +> **测试环境**:待测试 +> **工具版本**:GPT-4 / GPT-4 Turbo + +## 📋 任务描述 + +使用AI调试工具定位并修复一段存在错误或性能问题的代码。测试目标是评估工具发现bug的准确性、提供修复建议的可行性以及是否能生成复现步骤和自动修复补丁。 + +详细需求见:[Task 4 调试排障](../../../test-standards/test-tasks/task4-debugging.md) + +## ⚠️ 测试状态 + +**当前状态**:待测试 + +**说明**:此测试结果文件已创建,但尚未进行实际测试。ChatGPT Debug需要: +- OpenAI账户和订阅(GPT-4需要Plus订阅$20/月) +- 访问chat.openai.com或使用API +- 网络连接(云端服务) + +**测试计划**: +1. 准备包含多种bug类型的测试代码 +2. 使用ChatGPT分析代码问题 +3. 应用修复建议并验证 +4. 记录测试结果和评估指标 + +## 🛠️ 工具准备 + +### 预期安装步骤 + +1. **账户准备** + - 访问 https://chat.openai.com + - 创建账户或登录 + - 订阅ChatGPT Plus($20/月)以使用GPT-4 + +2. **使用方式选择** + - **Web界面**:直接在chat.openai.com使用 + - **API调用**:使用OpenAI API(需要API密钥) + - **IDE插件**:安装ChatGPT相关插件 + +### 预期版本信息 + +- **ChatGPT版本**:持续更新 +- **GPT-4版本**:gpt-4-1106-preview 或更新版本 +- **API版本**:openai-python 1.0.0+ + +## 📝 预期测试用例 + +### 测试用例1:逻辑错误 + +**代码**: +```python +def find_max(numbers): + """找到列表中的最大值""" + max_num = 0 + for num in numbers: + if num > max_num: + max_num = num + return max_num + +# 测试用例 +result = find_max([-5, -3, -1]) # 应该返回-1,但会返回0 +``` + +**预期行为**:ChatGPT应该能够识别初始值问题,建议使用`float('-inf')`或列表第一个元素。 + +### 测试用例2:边界条件错误 + +**代码**: +```python +def divide(a, b): + """计算a除以b的结果""" + return a / b + +# 测试用例 +result = divide(10, 0) # 会导致ZeroDivisionError +``` + +**预期行为**:ChatGPT应该识别除零错误,建议添加异常处理。 + +### 测试用例3:性能问题 + +**代码**: +```python +def fibonacci(n): + """计算斐波那契数列的第n项""" + if n <= 1: + return n + return fibonacci(n - 1) + fibonacci(n - 2) + +# 测试用例 +result = fibonacci(35) # 性能问题:递归调用过多 +``` + +**预期行为**:ChatGPT应该识别性能问题,建议使用动态规划或记忆化。 + +## 📝 预期测试流程 + +### 1. 工具调用方式 + +**预期方式**: +- **Web界面**:在chat.openai.com粘贴代码和错误信息 +- **API调用**:通过Python脚本调用OpenAI API +- **IDE插件**:在IDE中直接调用 + +### 2. 输入内容 + +**预期输入格式**: +``` +这段代码有什么问题?请分析并提供修复建议。 + +代码: +```python +[代码内容] +``` + +错误信息: +[错误堆栈或异常信息] + +测试用例: +[测试用例和预期行为] +``` + +### 3. 预期评估要点 + +- **Bug定位准确率**:是否能准确定位所有bug +- **修复建议可行性**:修复建议是否合理且无副作用 +- **解释充分性**:是否提供充分的错误根因分析 +- **测试生成能力**:是否能生成测试用例验证修复 + +## 📊 预期评估指标 + +### 效率指标 + +| 指标 | 预期值 | 说明 | +|-----|--------|------| +| Bug定位时间 | 待测试 | 预期:1-3分钟/bug | +| 修复建议生成时间 | 待测试 | 预期:30秒-2分钟 | +| 响应速度 | 待测试 | 预期:5-15秒/次 | +| 人工干预步骤数 | 待测试 | 预期:1-3步/bug | + +### 质量指标 + +| 指标 | 预期值 | 说明 | +|-----|--------|------| +| Bug定位准确率 | 待测试 | 预期:80-95% | +| 修复有效率 | 待测试 | 预期:85-95% | +| 解释充分性 | 待测试 | 预期:4-5/5 | +| 测试生成质量 | 待测试 | 预期:3-4/5 | + +## 🔄 与其他工具对比(预期) + +### vs Cursor Debug + +| 维度 | ChatGPT Debug | Cursor Debug | +|-----|---------------|--------------| +| Bug定位准确率 | 待测试 | ⭐⭐⭐⭐ | +| 响应速度 | 待测试 | ⭐⭐⭐⭐ | +| 价格 | ⭐⭐⭐($20/月) | ⭐⭐⭐($20/月) | +| IDE集成 | ⭐⭐⭐ | ⭐⭐⭐⭐⭐ | +| 解释充分性 | 待测试 | ⭐⭐⭐⭐ | + +## 📝 测试记录 + +**待补充**:实际测试结果将在此处记录 + +### 预期测试步骤 + +1. **准备测试代码** + - 准备包含多种bug类型的代码 + - 记录已知bug位置和类型 + +2. **使用ChatGPT分析** + - 输入代码和错误信息 + - 记录ChatGPT的分析结果 + - 记录修复建议 + +3. **应用修复** + - 应用ChatGPT的修复建议 + - 运行测试验证修复效果 + - 记录修复过程中的问题 + +4. **评估结果** + - 计算Bug定位准确率 + - 计算修复有效率 + - 评估解释充分性 + +--- + +**提示**:此测试结果文件为模板,需要实际测试ChatGPT Debug后才能填写完整内容。测试时请参考[测试标准](../../../test-standards/test-flow.md)和[质量指标](../../../test-standards/metrics/quality-metrics.md)。 + diff --git a/AI4SE-survey/tools/local-models/starcoder/test-results/task11-local-models.md b/AI4SE-survey/tools/local-models/starcoder/test-results/task11-local-models.md new file mode 100644 index 0000000..139b16d --- /dev/null +++ b/AI4SE-survey/tools/local-models/starcoder/test-results/task11-local-models.md @@ -0,0 +1,251 @@ +# StarCoder - Task 11: 本地大模型测试结果 + +> **测试工具**:StarCoder (15B) +> **测试任务**:Task 11 - 本地化大模型 +> **测试日期**:待测试 +> **测试版本**:StarCoder-15B + +## 📋 任务描述 + +评估可在本地部署、离线运行的开发辅助大模型的安装、性能与适配性。测试目标包括模型的安装与运行难度、推理性能、上下文理解能力以及与开发工作流程的整合能力。 + +详细需求见:[Task 11 本地化大模型](../../../test-standards/test-tasks/task11-local-models.md) + +## ⚠️ 测试状态 + +**当前状态**:待测试 + +**说明**:此测试结果文件已创建,但尚未进行实际测试。StarCoder作为本地部署的大模型,需要: +- 本地GPU环境(推荐24GB+ VRAM,15B模型较大) +- 模型下载和部署(约30GB模型文件) +- 配置推理服务 +- StarCoder基于800+编程语言训练,对多语言支持较好 + +**测试计划**: +1. 部署StarCoder-15B模型 +2. 配置API服务或IDE插件 +3. 使用标准测试用例进行测试 +4. 记录测试结果和评估指标 + +## 🛠️ 工具准备 + +### 预期安装步骤 + +#### 1. 环境准备 + +**系统环境**: +- **操作系统**:Linux/macOS/Windows(推荐Linux) +- **Python版本**:3.10+ +- **CUDA版本**:11.8+(GPU加速) +- **硬件配置**: + - CPU:现代多核CPU(推荐8核+) + - GPU:NVIDIA GPU with CUDA(推荐RTX 3090/4090或更高) + - 显存:24GB+ VRAM(15B模型,量化版本16GB) + - 内存:64GB+ RAM(推荐) + - 存储:50GB+可用空间(SSD推荐) + +#### 2. 安装依赖 + +```bash +# 创建虚拟环境 +python -m venv starcoder_env +source starcoder_env/bin/activate # Linux/macOS +# 或 +starcoder_env\Scripts\activate # Windows + +# 安装PyTorch(CUDA 11.8) +pip install torch torchvision torchaudio --index-url https://download.pytorch.org/whl/cu118 + +# 安装Transformers和加速库 +pip install transformers accelerate bitsandbytes sentencepiece protobuf +``` + +**预期安装时间**:约15-20分钟 + +#### 3. 下载模型 + +**方法**:使用Hugging Face Transformers自动下载 + +```python +from transformers import AutoTokenizer, AutoModelForCausalLM +import torch + +model_name = "bigcode/starcoder" +tokenizer = AutoTokenizer.from_pretrained(model_name) +model = AutoModelForCausalLM.from_pretrained( + model_name, + torch_dtype=torch.float16, + device_map="auto" +) +``` + +**预期下载时间**:约1-2小时(模型大小约30GB) +**预期显存占用**:约30GB VRAM + +#### 4. 配置量化(推荐) + +由于模型较大,强烈推荐使用量化: + +```python +from transformers import BitsAndBytesConfig + +quantization_config = BitsAndBytesConfig( + load_in_4bit=True, + bnb_4bit_compute_dtype=torch.float16, + bnb_4bit_use_double_quant=True, + bnb_4bit_quant_type="nf4" +) + +model = AutoModelForCausalLM.from_pretrained( + model_name, + quantization_config=quantization_config, + device_map="auto" +) +``` + +**量化后预期显存占用**:约8-10GB VRAM + +### 预期版本信息 + +- **模型版本**:StarCoder-15B +- **Transformers版本**:4.35.0+ +- **PyTorch版本**:2.0.0+ +- **CUDA版本**:11.8+ + +## 📝 预期测试用例 + +### 测试用例1:代码补全 + +**任务**:测试模型在代码补全任务中的表现 + +**输入**: +```python +def merge_sort(arr): + """ + 归并排序实现 + """ + if len(arr) <= 1: + return arr + mid = len(arr) // 2 + left = merge_sort(arr[:mid]) + right = merge_sort(arr[mid:]) + # [模型补全此处] +``` + +**预期评估**: +- 补全代码的正确性 +- 补全代码的质量 +- 响应时间 + +### 测试用例2:多语言代码生成 + +**任务**:测试模型对多种编程语言的支持(StarCoder优势) + +**输入**: +``` +使用以下语言实现快速排序: +1. Python +2. JavaScript +3. Java +4. Go +``` + +**预期评估**: +- 多语言代码生成能力 +- 代码正确性 +- 语言特性理解 + +### 测试用例3:代码搜索和理解 + +**任务**:测试模型的代码理解能力 + +**输入**: +```python +class BinaryTree: + def __init__(self, value): + self.value = value + self.left = None + self.right = None + + def insert(self, value): + # [复杂实现] +``` + +**问题**:解释这段代码的功能,并说明如何优化 + +**预期评估**: +- 代码理解准确性 +- 优化建议合理性 + +## 📊 预期评估指标 + +### 效率指标 + +| 指标 | 预期值 | 说明 | +|-----|--------|------| +| 启动时间 | 待测试 | 预期:60-120秒(模型较大) | +| 平均响应延迟 | 待测试 | 预期:5-15秒(取决于硬件) | +| 每秒请求数(QPS) | 待测试 | 预期:0.05-0.2 QPS | +| 内存/显存使用量 | 待测试 | 预期:30GB VRAM(15B模型,未量化) | + +### 质量指标 + +| 指标 | 预期值 | 说明 | +|-----|--------|------| +| 代码正确率 | 待测试 | 预期:75-85% | +| 多语言支持 | 待测试 | 预期:4-5/5(StarCoder优势) | +| 代码质量评分 | 待测试 | 预期:15-18/20 | +| 上下文理解能力 | 待测试 | 预期:3-4/5 | + +## 🔄 与其他工具对比(预期) + +### vs CodeLlama + +| 维度 | StarCoder | CodeLlama | +|-----|-----------|-----------| +| 代码质量 | 待测试 | 待测试 | +| 多语言支持 | ⭐⭐⭐⭐⭐(800+语言) | ⭐⭐⭐⭐ | +| 响应速度 | 待测试(较慢,模型大) | 待测试 | +| 模型大小 | 15B | 7B/13B/34B | +| 显存要求 | ⭐⭐(高) | ⭐⭐⭐(中等) | + +### vs Qwen-Coder + +| 维度 | StarCoder | Qwen-Coder | +|-----|-----------|------------| +| 代码质量 | 待测试 | 待测试 | +| 多语言支持 | ⭐⭐⭐⭐⭐(800+语言) | ⭐⭐⭐⭐ | +| 中文支持 | ⭐⭐ | ⭐⭐⭐⭐⭐ | +| 模型大小 | 15B | 7B/14B | +| 显存要求 | ⭐⭐(高) | ⭐⭐⭐(中等) | + +## 📝 测试记录 + +**待补充**:实际测试结果将在此处记录 + +### 预期测试步骤 + +1. **安装部署** + - 记录安装步骤和时间 + - 记录依赖和配置 + - 记录硬件要求(特别注意显存要求) + +2. **性能测试** + - 测试启动时间 + - 测试响应延迟 + - 测试资源占用(特别注意显存) + +3. **功能测试** + - 测试代码补全 + - 测试多语言代码生成 + - 测试代码理解和搜索 + +4. **稳定性测试** + - 测试长时间运行稳定性 + - 测试多次调用一致性 + - 测试资源受限环境表现(量化版本) + +--- + +**提示**:此测试结果文件为模板,需要实际部署和测试StarCoder后才能填写完整内容。StarCoder模型较大(15B),对硬件要求较高,建议使用量化版本。测试时请参考[测试标准](../../../test-standards/test-flow.md)和[效率指标](../../../test-standards/metrics/efficiency-metrics.md)。 +