智能工具库

Terminal-Bench-Science: Evaluating AI agents on scientific research workflows

Terminal-Bench-Science: Evaluating AI agents on scientific research workflows

Terminal-Bench-Science 0.1Terminal-Bench-Science evaluates AI agents on workflows from researchers' own work. Scientists, not model developers or data

2026-08-28 0来源:Hacker News (AI)

本文为来源内容的摘要快讯,点击文末链接阅读原文。

Terminal-Bench-Science 0.1Terminal-Bench-Science evaluates AI agents on workflows from researchers' own work. Scientists, not model developers or data

本文基于 Hacker News (AI) 的公开内容,由 AI 辅助整理改写后发布。

原标题:Terminal-Bench-Science: Evaluating AI agents on scientific research workflows

阅读原文