サンズラボは、実際のサイバー脅威データを収集・分析し、AI学習に必要な特徴情報と脅威ラベルを生成して検証可能なデータセットとして構築します。長年にわたる公共部門のサイバーセキュリティAIデータセット構築事業の経験と自社の脅威インテリジェンス・AI技術をもとに、データ構築からモデル検証・活用まで全プロセスを担います。
セキュリティAIの性能は、 どんな脅威を学習したかから始まります。
サイバー攻撃は絶えず変化し、新しいマルウェア、攻撃インフラ、攻撃手法が登場しています。 セキュリティAIが実際の脅威を検知するには、単にデータ量が多いだけでなく、最新性と文脈、正確なラベル、検証された特徴情報を備えた学習データが必要です。
最新の脅威を継続的に反映する必要があります。
過去のデータだけでは、新たに登場する攻撃キャンペーンや亜種の脅威を十分に学習するのが難しくなります。
IoCひとつだけでは攻撃を説明できません。
Hash、IP、Domain、URLだけでなく、攻撃グループ、攻撃手法、行動、脆弱性など相互に連結された文脈が必要です。
ラベルが間違っていれば、AIも誤って学習します。
セキュリティデータは、悪性・正常の判定だけでなく脅威タイプや特徴情報が正確に精製・ラベリングされている必要があります。
データはモデルが実際に学習できているかを検証する必要があります。
データを大量に構築するだけでは終わらず、AIモデルの定量的な性能と実環境への適用性もあわせて検証する必要があります。
4年間、サイバーセキュリティAIデータセットの 構築経験を積んできました。
サンズラボは2021年から2024年まで4年連続で公共部門のサイバーセキュリティAIデータセット構築事業を実施し、 計8件の事業でさまざまなサイバー脅威領域のデータ収集・加工・ラベリング・検証体制を構築してきました。
Cybersecurity AI Dataset R&D
公共部門のサイバーセキュリティAIデータセット構築事業を開始し、データ収集・加工体制を構築しました。
Cybersecurity AI Dataset R&D
データ構築領域を拡張し、ラベリング・品質検証プロセスを高度化しました。
AI Dataset最新化・高度化
最新の脅威データを反映してデータセットを最新化し、構築体制を高度化しました。
AI Dataset構築・活用の強化
構築したデータセットのAIモデル検証と活用体制を強化しました。
4年間、8つのセキュリティデータ領域を構築した経験
マルウェア
マルウェアファイル・行動分析に基づくデータセット構築経験。
侵害事故
侵害事故対応過程で蓄積された脅威データ構築経験。
アプリケーションセキュリティ
アプリケーションセキュリティの脆弱性・脅威データ構築経験。
能動型セキュリティ監視
能動型セキュリティ監視環境における脅威検知データ構築経験。
脅威プロファイリング
攻撃グループ・キャンペーンのプロファイリングデータ構築経験。
脅威ハンティング
脅威ハンティング過程で確保したデータ構築経験。
脅威インテリジェンス
脅威インテリジェンス分析に基づくデータ構築経験。
最新の侵害事故
最新の侵害事故対応事例に基づくデータ構築経験。
ファイル1つではなく、 攻撃の文脈をデータにします。
サンズラボは、ファイルとIoCの単純な収集を超えて、静的・動的分析、攻撃グループ、攻撃手法、脆弱性、ネットワーク関連情報など、AIが脅威を学習・説明するために必要な多様なセキュリティ特徴情報を構成します。
マルウェア・ファイル
PE/EXE、PDF、ELF、APKなどファイルタイプ別の静的・動的分析情報とファイル構造、Script/Object/API Call情報を構成します。
ネットワークIoC
IP、Domain、URL、DNS、Whoisと関連Binary、C2・拡散インフラ情報をあわせて構成します。
脅威コンテキスト
攻撃グループ、キャンペーン、MITRE ATT&CK TTP、脆弱性(CVE)、攻撃履歴と脅威タイプを連結します。
侵害事故・インテリジェンス
侵害事故情報、脅威レポート、OSINT、Threat Intelligence、攻撃キャンペーンの文脈をあわせて構成します。
収集から活用まで、 データの全ライフサイクルを構築します。
最新の脅威データ収集
自社の脅威インテリジェンスと多様なセキュリティ情報チャネルを活用し、ファイル、IoC、レポートなど最新の脅威情報を継続的に収集します。
静的・動的分析と特徴抽出
収集した生の脅威データを分析し、ファイル構造、行動、ネットワーク関連情報などAIが学習できる特徴情報を生成します。
脅威タイプと文脈のラベリング
悪性タイプ、攻撃グループ、攻撃手法などの脅威情報を標準化された基準に沿ってラベリングします。
データ品質の検証
準備性・完全性・有用性・適合性・正確性などの基準で、構築プロセスと結果データの品質を検証します。
標準化されたデータの保存・管理
JSONやSTIXなどの構造化フォーマットを活用してデータセットを保存し、他のセキュリティシステムと連携可能な形に構成します。
AIが実際に学習できているか確認
構築したデータセットでAIモデルを学習し、Precision、Recall、F1-Scoreなどの定量指標で実効性を検証します。
実証・共有・活用
検証済みのデータセットを実際のセキュリティモデルと需要環境に適用し、検索、API、パッケージングなど多様な方式で活用できる構造を構築します。
生の脅威情報を、 AIが読み取れる構造に。
生の脅威情報を、AIが読み取れる構造に。
File、IP、Domain、URL、レポートなどの生の脅威データを、静的・動的・文脈分析を経てFeature Extractionにつながるメタデータへ変換します。
脅威タイプと攻撃主体までラベリングします。
脅威タイプ、攻撃グループ、攻撃手法(TTP)を基準にラベリングし、AIが脅威を区別・説明できる形に構成します。
セキュリティシステムと連携できる標準化データ構造。
内部処理・システム連携にはJSONを、サイバー脅威インテリジェンスの相互運用性のためには国際標準であるSTIX 2.1構造を活用します。
多くのデータより、 学習可能なデータが重要です。
セキュリティAIデータセットの品質は、単純なデータ収集量では判断できません。 サンズラボは、構築プロセスの品質、データ自体の正確性、AIモデルの学習結果、実環境への適用性を段階的に検証します。
準備性
ポリシー・規定・組織・手続きなど、データ品質管理の基盤を確認します。
完全性
定義されたデータ構造と入力範囲が漏れなく構成されているかを確認します。
有用性
実際のAI学習目的と需要者の要求を満たすデータかを確認します。
適合性
多様性・信頼性・十分性・事実性など、学習データとしての適合性を検討します。
正確性
Ground TruthとLabel、Metadata値の正確性を検証します。
データは実際のAIモデルで検証します。
構築したデータセットが実際のセキュリティAIに有効かを確認するため、学習・テスト過程でモデル性能を測定し、検知結果を再びデータ品質の改善に活用します。
ファイルベースのマルウェア検知
PE/EXE、PDF、ELFなどのファイル特性をもとに悪性かどうかを分析します。
APT攻撃グループの識別
マルウェアと攻撃行動の特徴をもとに、攻撃グループとキャンペーンの文脈を分析します。
悪性ドメインの検知
Domainと関連Contextを活用し、フィッシング・C2などの悪性インフラを検知します。
データは検証された性能で証明します。
複数年にわたる外部機関基準のモデル性能検証を実施
2021〜2024年の公共部門サイバーセキュリティAIデータセット事業で構築したデータでAIモデルを学習し、外部機関基準の定量的な性能検証を実施しました。
検知結果を自然言語で説明
AIモデルの検知結果と関連特徴情報を生成AI(LLM)と接続し、脅威判断の根拠を自然言語で説明・要約する構造もあわせて検討しました。
構築したデータが、 実際のセキュリティ技術につながるように。

セキュリティAIの学習・高度化
マルウェア、攻撃グループ、悪性ドメインなど、セキュリティAIモデルの学習と性能改善に活用します。

セキュリティモデルの性能検証
検証済みのデータセットを活用し、AIモデルの検知性能と実効性を定量的に評価します。

脅威インテリジェンス分析
IoCと攻撃グループ、キャンペーン、TTPを連結し、単純な指標より豊かな脅威の文脈を分析できます。

企業・機関のセキュリティR&D
新しいAIセキュリティモデル、脅威分析技術、自動化研究のための基盤データとして活用できます。
データを作り、AIで検証し、 再びセキュリティ技術へつなげます。
サイバーセキュリティ専門企業
一般的なデータ専門企業ではなく、実際のサイバー脅威を分析してきたセキュリティ企業です。
自社の脅威データ基盤
大規模な自社脅威プロファイリングデータに基づく自社脅威インテリジェンスプラットフォームと分析データをもとにデータを構築できます。
AIモデル研究開発力
構築したデータでAIモデルを直接学習・検証できる研究開発力を保有しています。
全プロセスの遂行経験
収集・加工・ラベリング・検証・保存・活用まで、全プロセスの遂行経験を保有しています。
Cybersecurity AI Datasetについてよくある質問。
一般的なAI学習データと何が違うのですか?
サイバーセキュリティAIデータは単なるテキストや画像ではなく、マルウェア、IoC、攻撃グループ、攻撃手法、脆弱性など脅威間の関係と文脈が重要です。サンズラボは実際の脅威分析技術に基づき、セキュリティAIが学習できる特徴情報とラベルを構成します。
どのようなサイバーセキュリティ分野のデータを構築してきましたか?
2021〜2024年の公共部門事業を通じて、マルウェア、侵害事故、アプリケーションセキュリティ、能動型セキュリティ監視、脅威プロファイリング、脅威ハンティング、脅威インテリジェンス、最新の侵害事故など8つの領域でデータセット構築経験を保有しています。
データ品質はどのように検証しますか?
収集・加工・ラベリングの各段階でデータ品質を検査し、エラー分析と改善手続きを経ます。その後、構築したデータセットで実際のAIモデルを学習させ、Precision、Recall、F1-Scoreなどの性能指標を確認する方法でデータの実効性を検証します。
STIXのような標準フォーマットにも対応していますか?
公共部門事業では、JSONやSTIX 2.1などの構造化フォーマットを活用して脅威データを構成し、外部セキュリティシステムとの連携性を考慮したデータ構造を構築しました。
必要な目的に合わせて新しいデータセットを構築できますか?
サンズラボは、生の脅威データ収集から分析、メタデータ生成、ラベリング、品質検証、AIモデル検証まで、データパイプライン全体の構築経験を保有しています。実際の構築範囲は、研究目的やデータの権利、必要とされる脅威領域に応じて設計します。
このページのデータセットをそのまま購入できますか?
このページは特定の商用データセット商品というより、サンズラボのサイバーセキュリティAIデータ構築・検証力を紹介するR&Dページです。データ提供、共同研究、構築協力の可能範囲は、データの権利や事業条件に応じて別途協議します。
セキュリティAIに必要なデータから 一緒に設計します。
サイバー脅威データの収集・加工・ラベリングから品質検証、AIモデルの実証まで、サンズラボのデータ・AI研究力を活用してみてください。