AI・機械学習 Prompt Augmentation Scales up GRPO: 多様な推論テンプレートによる数学訓練の安定化
メタデータの配置: style_prompt に基づく識別子を先頭に配置。情報収集: DeepSeek-R1で採用されたGRPO(Group Relative Policy Optimization)および、その最新の改良手法である「Pro...
AI・機械学習
セキュリティ
PowerShell
VBA・Office
プロンプト・LLM活用
情報処理技術者試験
Linux・CLI・DevOps
セキュリティ
Microsoft 365・Azure
プロンプト・LLM活用