研究者ら、単一ステップ逆合成向けにC3LMを訓練
このモデルは、約4,560万件の検証済み反応を基に、Top-Kプロンプティングと妥当性報酬を活用する。
なぜ重要か
この論文は、単一回答による評価では、コンピューター支援合成計画の重要課題である逆合成が持つ「1つの問いに複数の答えがあり得る」性質を捉えきれないと主張する。LLMと従来型モデルが相補的な反応空間を探索するという結果は、化学AIにおけるアンサンブルシステムの可能性を示している。
要点
- 1.C3LMは、妥当性を考慮した訓練により単一ステップ逆合成を対象とする。
- 2.データセットには約4,560万件の検証済み反応が含まれる。
- 3.LLMと従来型モデルは、アンサンブルで組み合わせることで最も効果を発揮する可能性がある。
研究者らは、単一ステップ逆合成のためのChemistry Constraint-Consistent Language ModelであるC3LMを発表した。この研究では、Top-Kプロンプティングによって多様で妥当性の高い反応予測を生成し、約4,560万件の検証済み反応からなるデータセットCREED-CCV-2+USPTO-XLで訓練している。ファインチューニングに加え、ChemCensorベースの報酬と新規性を重視した報酬を用いることで、分布外ベンチマークURSA-expert-2026において最先端の性能を報告している。
⚡ 今日から使える
逆合成モデルは、単一回答の正解率だけでなく、Top-Kの妥当な出力で評価すべきだ。
出典・一次報道
本記事は以下の媒体の報道を要約し、リンクしています。
- arXiv cs.LGTraining Chemical Plausibility-Aware Large Language Models for Single-Step RetrosynthesisAug 20, 12:00 PM↗
- arXiv cs.AITraining Chemical Plausibility-Aware Large Language Models for Single-Step RetrosynthesisAug 20, 12:00 PM↗
- arXiv cs.CLTraining Chemical Plausibility-Aware Large Language Models for Single-Step RetrosynthesisAug 20, 12:00 PM↗
- HF Daily PapersTraining Chemical Plausibility-Aware Large Language Models for Single-Step RetrosynthesisAug 19, 4:00 AM↗
この記事が役に立ちましたか?次号をメールでお届けします。
関連: 研究
研究
MemTrapBench、LLMの記憶利用に潜む認知的な落とし穴を検証
このベンチマークは、検索された記録が関連性のあるものでも、記憶がタスク性能を低下させ得ることを示した。
arXiv cs.LG+1 outlet·3h ago
研究
AI4AI-Bench、エージェントの訓練アルゴリズム設計能力を検証
arXivの新ベンチマークは、LLMエージェントが凍結されたリポジトリ群で訓練アルゴリズムを書き換えられるかを評価する。
arXiv cs.LG+1 outlet·3h ago
研究
新論文群、長文脈AI向けスパースアテンションに照準
研究者らが、長文脈推論、サービング、動画生成、メモリをより低コストにする手法を提案。
arXiv cs.CL+1 outlet·3h ago