中文 | English
量化评估元指令在不同模型、不同场景下的输出质量提升幅度
| # | 维度 | 评分标准 | 1 分 | 3 分 | 5 分 |
|---|---|---|---|---|---|
| D1 | 角色准确度 | 模型是否选择了正确的角色,且未越权 | 完全无角色或严重越权 | 角色基本正确但有轻微越权 | 角色精准、严格在领域内 |
| D2 | 边界控制 | 是否避免了虚构业务数据和假定技术栈 | 大量虚构数据和假定 | 偶有虚构但可控 | 零虚构,严格基于用户输入 |
| D3 | 格式规范 | 输出是否符合双版本 + 自检清单的结构要求 | 无结构、格式混乱 | 基本有结构但不完整 | 完整的双版本 + 自检清单 |
| D4 | 结构完整性 | 输出内容是否逻辑自洽、层次清晰 | 逻辑混乱、无层次 | 有基本逻辑但不严谨 | 逻辑闭环、层次分明 |
| D5 | 防幻觉 | 是否包含未经用户确认的事实性陈述 | 大量幻觉事实 | 偶有幻觉但影响可控 | 零幻觉,所有事实均来自用户输入 |
| 模型 | 版本 |
|---|---|
| GPT | GPT-4o |
| Claude | Claude Sonnet 4 |
| DeepSeek | DeepSeek-V3 |
| 豆包 | Doubao-Pro |
| # | 场景 | 类别 | 输入 |
|---|---|---|---|
| S1 | 微信购物商城小程序 | 开发 | 我想开发一套微信购物商城小程序 |
| S2 | 企业后台管理系统 | 开发 | 我需要开发一套企业后台管理系统 |
| S3 | 社区 APP PRD | 文档 | 撰写社区APP完整PRD文档 |
| S4 | 竞品分析报告 | 文档 | 帮我撰写抖音的竞品分析报告 |
| S5 | Kotlin 网络框架 | 代码 | 使用 Kotlin 实现 Android 通用网络请求框架 |
| S6 | Python 爬虫 | 代码 | 帮我编写一个通用网页爬虫框架 |
| S7 | 新品发布方案 | 文案 | 帮我撰写一款智能手表的新品发布活动方案 |
| S8 | 用户增长策略 | 文案 | 制定一款 B2B SaaS 产品的用户增长策略 |
| S9 | 技术架构设计 | 开发 | 设计一个日活百万的即时通讯系统架构 |
| S10 | 数据分析报告 | 文档 | 帮我撰写一份电商用户行为数据分析报告 |
🔬 以下为示例数据,基于 GPT-4o 在 S1(小程序)和 S3(PRD)两个场景上的模拟测试。 鼓励用户自行验证并提交真实数据(见文末贡献指引)。
| 维度 | 无元指令 | 有元指令 | 提升 |
|---|---|---|---|
| D1 角色准确度 | 2/5 | 5/5 | +3 |
| D2 边界控制 | 1/5 | 4/5 | +3 |
| D3 格式规范 | 1/5 | 5/5 | +4 |
| D4 结构完整性 | 2/5 | 5/5 | +3 |
| D5 防幻觉 | 1/5 | 4/5 | +3 |
| 总分 | 7/25 | 23/25 | +16 |
关键发现:
- 无元指令时,模型虚构了"预算 20 万、团队 5 人、技术栈 Spring Boot + MySQL"——均为用户未提及的内容
- 有元指令后,模型严格约束在产品功能规划范围,零技术栈假定、零业务数据虚构
| 维度 | 无元指令 | 有元指令 | 提升 |
|---|---|---|---|
| D1 角色准确度 | 3/5 | 5/5 | +2 |
| D2 边界控制 | 1/5 | 5/5 | +4 |
| D3 格式规范 | 2/5 | 5/5 | +3 |
| D4 结构完整性 | 2/5 | 5/5 | +3 |
| D5 防幻觉 | 1/5 | 5/5 | +4 |
| 总分 | 9/25 | 25/25 | +16 |
关键发现:
- 无元指令时,模型虚构了"100 万 DAU、微服务架构、广告+会员商业模式"——完全脱离用户实际
- 有元指令后,PRD 结构完整、所有数据均标注为"待确认"、无任何技术选型假定
复制以下模板,自行测试并记录结果:
| 场景 | 模型 | D1 角色 | D2 边界 | D3 格式 | D4 结构 | D5 防幻觉 | 总分 | 备注 |
|------|------|--------|--------|--------|--------|----------|------|------|
| S1 | | /5 | /5 | /5 | /5 | /5 | /25 | |
| S2 | | /5 | /5 | /5 | /5 | /5 | /25 | |
| S3 | | /5 | /5 | /5 | /5 | /5 | /25 | |
| ... | | | | | | | | |如果你进行了实际测试,欢迎提交结果:
- Fork 本仓库
- 在本文件中补充你的测试数据(标注模型版本和测试日期)
- 提交 Pull Request,标题格式:
benchmark: [模型名] [场景编号] 测试结果
⚠️ 请确保数据真实可复现,附上完整的输入和输出截图。