2024年5月27日(月)13時〜、KSKアナリティクス主催の「第2回 RapidMiner AIコンテスト 発表会」をオンラインにて開催しました。本レポートは、発表会の内容を要約したものです。
はじめに
昨年実施した第1回 RapidMiner AIコンテストでは、振動データを用いた車両の分類を実施しましたが、第2回 RapidMiner AIコンテストでは、過去の気象予報情報などから一日先の太陽光発電量を予測するモデルを作成し、その予測精度を競っていただきました。2023年12月20日から2024年3月31日までの約3ヶ月間に渡り実施しました。本発表会では、コンテストで優秀な成績を収めた部門別(20〜30代部門、40代部門、50代以上部門)優勝者3名の方より分析アプローチについてご報告いただきました。
コンテスト概要・結果
本コンテストの分析課題である「太陽光発電量の予測」は、需給管理と異常検知の2つの実践的な活用を想定して設定しました。分析課題の狙いは以下の3つです。
| ・天気と風のテキストデータをどのようにテーブルデータに変換するか ・日の出、日の入情報からどのように特徴を生成するか ・季節の変わり目を予測する課題であり、学習していない範囲をどのようにカバーするか |

最終的に、約60名のエントリーから28名の予測結果が投稿されました。
実施期間中は最後までスコアが僅差で混戦が繰り広げられ、最高スコアは、東芝デベロップメントエンジニアリング株式会社 國崎様のRMSE: 0.2310でした。最終順位表はこちらよりご確認ください。
発表内容
【20~30代部門1位】
東芝デベロップメントエンジニアリング株式会社 ビジネスデータアナリシスチーム 國崎 恒成 様

分析アプローチの紹介
太陽光発電量のトレンドと周期性を踏まえ、Window処理を行いLightGBMによる予測モデルを構築されました。データ前処理では、天気予報のテキストデータに対してChatGPTを使用し、朝・昼・夜の天気予報置き換え表を作成するなど工夫されています(不完全な部分は一部人力で補完)。予測結果を説明変数に加えたことで発生した誤差伝播を抑制するために、過去の代表的な波形を学習させ周期性を再現しようと試みられたものの、曇りや雨の日の精度が低いという問題がありました。それらの問題を解決するために、日照時間データ(外部データ)を追加したことが精度向上につながっています(運用時は次の日の日照時間予報を活用)。汎化性能を高めるためにGBDT系モデル[1]に加え、NN系モデルも使用されています。
感想(発表コメント抜粋)
コンテスト中は、モデルの精度向上に向けて試行錯誤を繰り返しました。特に、代表波形の学習には2ヶ月ほどかかり、苦労しました。振り返ってみると、モデルのアンサンブル比率調整やトレンド推定モデルの組み合わせなど、改善の余地はあったと感じています。RapidMinerの使用を通して、プログラムのつながりを視覚的に確認できることの利便性を改めて実感しました。今回の誤差伝播調査では、プロセス全体を俯瞰して考察することができたことが素早い原因特定につながりました。
【40代部門1位】
三菱ケミカル株式会社 サプライチェーン所管 オペレーション(日本)本部 九州事業所 企画管理部 生産技術・DXグループ 廣井 悟 様

分析アプローチの紹介
データ前処理は、天気予報と風情報のテキストデータから、独自の書き出し表示のルール設定と時間帯に応じた表現の切り分けに基づいて特徴量抽出されました。降水確率の粒度は、前日に発表された天気予報のずれを吸収するため、移動平均を用いて補正されています。季節変化による発電量減衰を考慮するため、日射角度と発電量の関係をモデル化し、変数変換を行うなど工夫されていました。モデル構築にはRandom Forestが使用され、時間帯による太陽光の日射角度が発電量に大きく影響する重要な特徴量として扱われています。降水確率と発電量が大きく乖離する外れ値や外乱を抽出して取り除き、再学習させることでモデルの精度向上を実現されました。
感想(発表コメント抜粋)
自己研鑽と今後の業務への応用を目的にコンテストへ参加しました。RapidMinerはKSKアナリティクスの講習動画で履修していましたが、明確な課題に取り組んだのは初めての経験でした。今回の解析では、Random Forest以外のモデルのフィッティングに苦労しました。また、色々なアイデアで特徴量や処理をする中で、より効率的なオペレータの活用について課題を感じました。今後は、目的に合った手法を理解し、業務を含めて応用の幅を広げていきたいです。
【50代部門1位】
株式会社 日本触媒 DX推進部 導入支援グループ 中谷 香織 様

分析アプローチの紹介
太陽高度に着目し、時間帯別のモデルを構築されました。太陽高度は、太陽赤緯[2]や均時差の数表などを用いて計算されたものです。天気予報と風予報のテキストデータは簡単な分類を行い、数値データに対しては扱いやすく変換されています。発電量の実測値と予測値の可視化から、太陽光度が低い時間帯に予測値が下振れしていることが判明。太陽高度が低い“朝夕”、太陽光度が高い“昼”、太陽光が発電しない“夜”の3つにモデルを分割したところ、精度の向上が見られました。各時間帯のモデルは、Random Forest(朝夕、昼)とDefault Model(夜)が使用されています。さらに、データ取得状況を推測し、太陽光パネルの設置角を簡易補正されていました。前処理サブプロセスの共有化を行って分析の効率化も図られており、特徴的なアプローチとなりました。
感想(発表コメント抜粋)
予測結果のずれの原因究明と解決策のアイデア出しに多くの時間を費やしました。特に、太陽光度の計算は労力を要しました。今回の分析では、データの扱いに改善の余地を感じています。今後は、機械学習の理解を深め、様々なモデルやハイパーパラメータの最適化、変数選択を行っていきたいです。
社内にもRapidMiner愛好者を増やし、次回のコンテストでは一緒に参加できるメンバーが増えればもっと楽しいのではないかと考えています。
総評・コメント
- ChatGPTを用いたデータ処理が印象的で、汎用的なLLMが日常業務にも活用され始めていると感じました。RapidMinerにもその機能が導入されていますので、ぜひお試しください。また、時系列データに特化したモデルに固執せず、問題の本質を理解し通常のテーブルデータとして予測できるモデル選択や変数設計を工夫されていていることが印象的でした。(アルテアエンジニアリング株式会社 芝田 隆宏氏)
- LLM機能はテキストデータ処理を飛躍的に向上させます。RapidMinerの活用事例を紹介するブログでご紹介しておりますのでご参考にしていただければと思います。今後社内でもRapidMinerの利用者とコンテスト参加者を増やしていきたいと考えています。(ネットワンシステムズ株式会社 大河原 昂也氏)
- それぞれ異なるアプローチで課題に取り組んでおられ非常に感銘を受けました。上位入賞者の方には共通点があり、論理的な分析と直感的なひらめきをバランス良く活用して素晴らしい成果を出されていると感じました。発表会は分析の振り返り共有の場として今後も継続していきたいと考えています。次回のコンテストにはぜひ社内の方々と一緒にご参加ください。(株式会社KSKアナリティクス 森本 好映氏)
最後に
本コンテストにご参加いただいた皆様ならびにご支援いただいた関係各位に心より感謝申し上げます。
Altair®RapidMiner®ついての詳細は、こちらをご覧ください。
[1] GBDT:勾配降下法(Gradient)、ブースティング(Boosting)、そして決定木(Decision Tree)という3つの手法を組み合わせた機械学習アルゴリズム。[2] 赤緯(Dec, declination):天の赤道を 0°とし、北極方向を正として±90°まで定めた角度。
カテゴリー: イベント, データアナリティクス




