トレンド一覧

化学実験の計画と実行能力を評価するonepot-Bench 0

arXiv cs.LG ・ 2026-08-03

原題: onepot-Bench 0: towards lab-aware in silico chemistry benchmarks

AI による要約

実験科学における言語モデルの計画・実行能力を正確に評価するため、化学情報学の知識や安全性・拒否行動を測定する新しいベンチマークスイート「onepot-Bench 0」を提案しています。ウェットラボでの信頼性の高い意思決定に必要な能力を評価します。

この要約は当サイトの AI が生成したものです。正確な内容は 元記事(arXiv cs.LG)をご確認ください。

研究・論文