🧠 模型路由月报 v0.3 — 2026-06

模式: Online Compute Policy Learning System 总请求: 3 | 估算成本: 3 units

📊 模型使用分布

模型次数占比成本/次总成本
deepseek-v4-flash3100.0%1.03

📈 Flash / Pro 比例

| 🔵 Flash | 3 | 100.0% | | 🟣 Pro | 0 | 0.0% | | 🟠 Ollama | 0 | 0.0% |

🔷 Layer 1: Decision Policy 评分

模型可靠性策略权重当前score
deepseek-v4-pro1.0001.00000.2000
deepseek-v4-flash1.0001.14281.0000
ollama:qwen3:14b1.0001.0000100.0000

🔷 Layer 3: Critic 评估

模型平均reward总reward评估次数
deepseek-v4-pro0.00000.00000
deepseek-v4-flash0.95002.85003
ollama:qwen3:14b0.00000.00000

Critic公式: reward = success × quality - cost_penalty - latency_penalty 学习率 α: 0.05 | 衰减: exp(-t/30d)

🔷 Layer 4: Weight Update

模型旧权重新权重Δ建议
deepseek-v4-pro1.001.0000+0.0000→ 稳定
deepseek-v4-flash1.001.1428+0.1428📈 提升权重
ollama:qwen3:14b1.001.0000+0.0000→ 稳定

权重变化详情

deepseek-v4-flash:

  • 2026-06-13T15:20 reward=0.9500 decay=1.00 Δ=+0.0476 → w=1.0476
  • 2026-06-13T15:30 reward=0.9500 decay=1.00 Δ=+0.0476 → w=1.0952
  • 2026-06-13T15:45 reward=0.9500 decay=1.00 Δ=+0.0476 → w=1.1428

🎲 ε-greedy Exploration

参数
ε 当前0.08
ε 目标0.03
实际探索率66.7%
探索事件2
利用事件1

🏷️ 任务类型分布

  • simple: 1 (33.3%)
  • tool_use: 1 (33.3%)
  • coding: 1 (33.3%)

⚡ 行动建议

  • ✅ 所有指标健康,策略权重稳定

📐 进化指标

  • 系统模式: Online Policy Learning
  • 学习率: α=0.05
  • 衰减半衰期: 30天
  • 策略权重范围: [0.1, 10.0]
  • 平均cost/req: 1.0