Terminal-Bench-Science: Evaluating AI agents on scientific research workflows

Terminal-Bench-Science 0.1Terminal-Bench-Science evaluates AI agents on workflows from researchers' own work. Scientists, not model developers or data
2026-08-28 0来源:Hacker News (AI)
本文为来源内容的摘要快讯,点击文末链接阅读原文。
Terminal-Bench-Science 0.1Terminal-Bench-Science evaluates AI agents on workflows from researchers' own work. Scientists, not model developers or data
本文基于 Hacker News (AI) 的公开内容,由 AI 辅助整理改写后发布。
原标题:Terminal-Bench-Science: Evaluating AI agents on scientific research workflows
阅读原文