介绍 LifeSciBench:评估 AI 生命科学研究能力的新基准测试
OpenAI 推出 LifeSciBench,这是一个由专家撰写和评审的基准测试,用于评估 AI 系统处理真实世界生命科学研究任务的能力,涵盖 750 个任务和多个生物领域。
OpenAI 推出 LifeSciBench,这是一个由专家撰写和评审的基准测试,用于评估 AI 系统处理真实世界生命科学研究任务的能力,涵盖 750 个任务和多个生物领域。
Introducing LifeSciBench, an expert-authored, expert-reviewed benchmark for evaluating how AI systems handle real-world life science research tasks and decisions.
最新研究表明,AI 在文本说服力上已超过人类专家,甚至在真实募捐场景中表现更佳,这可能导致权力重新集中,也可能为弱势群体提供新工具。
物理世界AI的下一步
AI推理时代的Token工厂
四大互联网分别领投
重写“AI如何反复推演世界”
共同推进物理AI前沿技术探索。
OpenSquilla 上线后数周内 GitHub star 增至数千量级