AI Coding Evaluation Topic Map

這是 AI coding agent 評測、trace、post-training 與軟體品質控制的主題導覽。

Evaluation as product spec

Trace and improvement

Engineering practices

Raw sources

  • raw/articles/aihao-eval-is-spec-2026-05-20.md
  • raw/articles/aihao-generic-ai-metrics-mirage-2026-02-17.md
  • raw/articles/google-research-better-ai-benchmarks-raters-2026-03-31.md
  • raw/articles/google-research-convapparel-user-simulators-2026-04-09.md
  • raw/articles/google-research-dialoglab-human-ai-group-conversations-2026-02-10.md
  • raw/articles/google-research-bayesian-teaching-llm-reasoning-2026-03-04.md
  • raw/articles/aihao-traces-new-source-of-truth-2026-02-17.md
  • raw/articles/aihao-replit-agent-eval-scale-2026-06-01.md
  • raw/articles/aihao-harness-engineering-model-harness-fit-2026-06-26.md
  • raw/articles/google-research-knowledge-profiling-parametric-factuality-2026-08-12.md
  • raw/articles/bnext-gemini-3-7-flash-2026-08-14.md
  • raw/transcripts/training-agents-coding-agent-continual-learning-2026-06-22.md
  • raw/transcripts/hermes-model-specific-system-prompts-2026-06-18.md