🧠 模型路由月报 v0.3 — 2026-06
模式: Online Compute Policy Learning System
总请求: 3 | 估算成本: 3 units
📊 模型使用分布
| 模型 | 次数 | 占比 | 成本/次 | 总成本 |
|---|
| deepseek-v4-flash | 3 | 100.0% | 1.0 | 3 |
📈 Flash / Pro 比例
| 🔵 Flash | 3 | 100.0% |
| 🟣 Pro | 0 | 0.0% |
| 🟠 Ollama | 0 | 0.0% |
🔷 Layer 1: Decision Policy 评分
| 模型 | 可靠性 | 策略权重 | 当前score |
|---|
| deepseek-v4-pro | 1.000 | 1.0000 | 0.2000 |
| deepseek-v4-flash | 1.000 | 1.1428 | 1.0000 |
| ollama:qwen3:14b | 1.000 | 1.0000 | 100.0000 |
🔷 Layer 3: Critic 评估
| 模型 | 平均reward | 总reward | 评估次数 |
|---|
| deepseek-v4-pro | 0.0000 | 0.0000 | 0 |
| deepseek-v4-flash | 0.9500 | 2.8500 | 3 |
| ollama:qwen3:14b | 0.0000 | 0.0000 | 0 |
Critic公式: reward = success × quality - cost_penalty - latency_penalty
学习率 α: 0.05 | 衰减: exp(-t/30d)
🔷 Layer 4: Weight Update
| 模型 | 旧权重 | 新权重 | Δ | 建议 |
|---|
| deepseek-v4-pro | 1.00 | 1.0000 | +0.0000 | → 稳定 |
| deepseek-v4-flash | 1.00 | 1.1428 | +0.1428 | 📈 提升权重 |
| ollama:qwen3:14b | 1.00 | 1.0000 | +0.0000 | → 稳定 |
权重变化详情
deepseek-v4-flash:
- 2026-06-13T15:20 reward=0.9500 decay=1.00 Δ=+0.0476 → w=1.0476
- 2026-06-13T15:30 reward=0.9500 decay=1.00 Δ=+0.0476 → w=1.0952
- 2026-06-13T15:45 reward=0.9500 decay=1.00 Δ=+0.0476 → w=1.1428
🎲 ε-greedy Exploration
| 参数 | 值 |
|---|
| ε 当前 | 0.08 |
| ε 目标 | 0.03 |
| 实际探索率 | 66.7% |
| 探索事件 | 2 |
| 利用事件 | 1 |
🏷️ 任务类型分布
- simple: 1 (33.3%)
- tool_use: 1 (33.3%)
- coding: 1 (33.3%)
⚡ 行动建议
📐 进化指标
- 系统模式: Online Policy Learning
- 学习率: α=0.05
- 衰减半衰期: 30天
- 策略权重范围: [0.1, 10.0]
- 平均cost/req: 1.0