本文へスキップ
CYBERSECURITY AI DATASET

サンズラボは、実際のサイバー脅威データを収集・分析し、AI学習に必要な特徴情報と脅威ラベルを生成して検証可能なデータセットとして構築します。長年にわたる公共部門のサイバーセキュリティAIデータセット構築事業の経験と自社の脅威インテリジェンス・AI技術をもとに、データ構築からモデル検証・活用まで全プロセスを担います。

4年間 — 公共サイバーセキュリティデータセット事業を継続実施8つのデータセット領域 — サイバーセキュリティデータ構築の経験エンドツーエンド — 収集から品質検証・活用までAI検証済み — AIモデルによるデータ実効性検証
WHY SECURITY DATA MATTERS

セキュリティAIの性能は、 どんな脅威を学習したかから始まります。

サイバー攻撃は絶えず変化し、新しいマルウェア、攻撃インフラ、攻撃手法が登場しています。 セキュリティAIが実際の脅威を検知するには、単にデータ量が多いだけでなく、最新性と文脈、正確なラベル、検証された特徴情報を備えた学習データが必要です。

01FRESHNESS

最新の脅威を継続的に反映する必要があります。

過去のデータだけでは、新たに登場する攻撃キャンペーンや亜種の脅威を十分に学習するのが難しくなります。

02CONTEXT

IoCひとつだけでは攻撃を説明できません。

Hash、IP、Domain、URLだけでなく、攻撃グループ、攻撃手法、行動、脆弱性など相互に連結された文脈が必要です。

03LABEL QUALITY

ラベルが間違っていれば、AIも誤って学習します。

セキュリティデータは、悪性・正常の判定だけでなく脅威タイプや特徴情報が正確に精製・ラベリングされている必要があります。

04VALIDATION

データはモデルが実際に学習できているかを検証する必要があります。

データを大量に構築するだけでは終わらず、AIモデルの定量的な性能と実環境への適用性もあわせて検証する必要があります。

PROVEN R&D EXPERIENCE

4年間、サイバーセキュリティAIデータセットの 構築経験を積んできました。

サンズラボは2021年から2024年まで4年連続で公共部門のサイバーセキュリティAIデータセット構築事業を実施し、 計8件の事業でさまざまなサイバー脅威領域のデータ収集・加工・ラベリング・検証体制を構築してきました。

012021

Cybersecurity AI Dataset R&D

公共部門のサイバーセキュリティAIデータセット構築事業を開始し、データ収集・加工体制を構築しました。

022022

Cybersecurity AI Dataset R&D

データ構築領域を拡張し、ラベリング・品質検証プロセスを高度化しました。

032023

AI Dataset最新化・高度化

最新の脅威データを反映してデータセットを最新化し、構築体制を高度化しました。

042024

AI Dataset構築・活用の強化

構築したデータセットのAIモデル検証と活用体制を強化しました。

8 DATASET DOMAINS

4年間、8つのセキュリティデータ領域を構築した経験

01

マルウェア

マルウェアファイル・行動分析に基づくデータセット構築経験。

02

侵害事故

侵害事故対応過程で蓄積された脅威データ構築経験。

03

アプリケーションセキュリティ

アプリケーションセキュリティの脆弱性・脅威データ構築経験。

04

能動型セキュリティ監視

能動型セキュリティ監視環境における脅威検知データ構築経験。

05

脅威プロファイリング

攻撃グループ・キャンペーンのプロファイリングデータ構築経験。

06

脅威ハンティング

脅威ハンティング過程で確保したデータ構築経験。

07

脅威インテリジェンス

脅威インテリジェンス分析に基づくデータ構築経験。

08

最新の侵害事故

最新の侵害事故対応事例に基づくデータ構築経験。

SECURITY DATA COVERAGE

ファイル1つではなく、 攻撃の文脈をデータにします。

サンズラボは、ファイルとIoCの単純な収集を超えて、静的・動的分析、攻撃グループ、攻撃手法、脆弱性、ネットワーク関連情報など、AIが脅威を学習・説明するために必要な多様なセキュリティ特徴情報を構成します。

01 — MALWARE & FILE

マルウェア・ファイル

PE/EXE、PDF、ELF、APKなどファイルタイプ別の静的・動的分析情報とファイル構造、Script/Object/API Call情報を構成します。

02 — NETWORK IoC

ネットワークIoC

IP、Domain、URL、DNS、Whoisと関連Binary、C2・拡散インフラ情報をあわせて構成します。

03 — THREAT CONTEXT

脅威コンテキスト

攻撃グループ、キャンペーン、MITRE ATT&CK TTP、脆弱性(CVE)、攻撃履歴と脅威タイプを連結します。

04 — INCIDENT & INTELLIGENCE

侵害事故・インテリジェンス

侵害事故情報、脅威レポート、OSINT、Threat Intelligence、攻撃キャンペーンの文脈をあわせて構成します。

END-TO-END DATA PIPELINE

収集から活用まで、 データの全ライフサイクルを構築します。

構造化データセット生成パイプライン多様なサイバーセキュリティデータセットマルウェア脅威プロファイリング侵害事故能動型セキュリティ監視脅威インテリジェンスアプリケーションセキュリティ脅威ハンティング最新の侵害事故AI活用のための検証済みデータセットAI学習最適化高品質データ最新性の維持実戦型データセット01収集多様な脅威ソース02精製・正規化重複除去03ラベリング専門家分類04検証二重検収05継続的更新最新脅威を反映最新脅威データセットの継続生成定期生成定期的・自動化されたデータセット生成ラベル検証専門家によるラベル検証プロセス品質管理継続的な品質モニタリングと改善
0101 COLLECT

最新の脅威データ収集

自社の脅威インテリジェンスと多様なセキュリティ情報チャネルを活用し、ファイル、IoC、レポートなど最新の脅威情報を継続的に収集します。

0202 ANALYZE & PROCESS

静的・動的分析と特徴抽出

収集した生の脅威データを分析し、ファイル構造、行動、ネットワーク関連情報などAIが学習できる特徴情報を生成します。

0303 LABEL

脅威タイプと文脈のラベリング

悪性タイプ、攻撃グループ、攻撃手法などの脅威情報を標準化された基準に沿ってラベリングします。

0404 VALIDATE

データ品質の検証

準備性・完全性・有用性・適合性・正確性などの基準で、構築プロセスと結果データの品質を検証します。

0505 STORE

標準化されたデータの保存・管理

JSONやSTIXなどの構造化フォーマットを活用してデータセットを保存し、他のセキュリティシステムと連携可能な形に構成します。

0606 MODEL VALIDATION

AIが実際に学習できているか確認

構築したデータセットでAIモデルを学習し、Precision、Recall、F1-Scoreなどの定量指標で実効性を検証します。

0707 UTILIZE

実証・共有・活用

検証済みのデータセットを実際のセキュリティモデルと需要環境に適用し、検索、API、パッケージングなど多様な方式で活用できる構造を構築します。

AI-READY DATA

生の脅威情報を、 AIが読み取れる構造に。

01

生の脅威情報を、AIが読み取れる構造に。

File、IP、Domain、URL、レポートなどの生の脅威データを、静的・動的・文脈分析を経てFeature Extractionにつながるメタデータへ変換します。

02

脅威タイプと攻撃主体までラベリングします。

脅威タイプ、攻撃グループ、攻撃手法(TTP)を基準にラベリングし、AIが脅威を区別・説明できる形に構成します。

03

セキュリティシステムと連携できる標準化データ構造。

内部処理・システム連携にはJSONを、サイバー脅威インテリジェンスの相互運用性のためには国際標準であるSTIX 2.1構造を活用します。

QUALITY & VALIDATION

多くのデータより、 学習可能なデータが重要です。

セキュリティAIデータセットの品質は、単純なデータ収集量では判断できません。 サンズラボは、構築プロセスの品質、データ自体の正確性、AIモデルの学習結果、実環境への適用性を段階的に検証します。

READINESS

準備性

ポリシー・規定・組織・手続きなど、データ品質管理の基盤を確認します。

COMPLETENESS

完全性

定義されたデータ構造と入力範囲が漏れなく構成されているかを確認します。

USEFULNESS

有用性

実際のAI学習目的と需要者の要求を満たすデータかを確認します。

FITNESS

適合性

多様性・信頼性・十分性・事実性など、学習データとしての適合性を検討します。

ACCURACY

正確性

Ground TruthとLabel、Metadata値の正確性を検証します。

MODEL-BASED VALIDATION

データは実際のAIモデルで検証します。

構築したデータセットが実際のセキュリティAIに有効かを確認するため、学習・テスト過程でモデル性能を測定し、検知結果を再びデータ品質の改善に活用します。

FILE MALWARE DETECTION

ファイルベースのマルウェア検知

PE/EXE、PDF、ELFなどのファイル特性をもとに悪性かどうかを分析します。

APT ATTRIBUTION

APT攻撃グループの識別

マルウェアと攻撃行動の特徴をもとに、攻撃グループとキャンペーンの文脈を分析します。

MALICIOUS DOMAIN DETECTION

悪性ドメインの検知

Domainと関連Contextを活用し、フィッシング・C2などの悪性インフラを検知します。

VALIDATION RECORD

データは検証された性能で証明します。

複数年にわたる外部機関基準のモデル性能検証を実施

2021〜2024年の公共部門サイバーセキュリティAIデータセット事業で構築したデータでAIモデルを学習し、外部機関基準の定量的な性能検証を実施しました。

検知結果を自然言語で説明

AIモデルの検知結果と関連特徴情報を生成AI(LLM)と接続し、脅威判断の根拠を自然言語で説明・要約する構造もあわせて検討しました。

DATA UTILIZATION

構築したデータが、 実際のセキュリティ技術につながるように。

セキュリティAIの学習・高度化
AI MODEL TRAINING

セキュリティAIの学習・高度化

マルウェア、攻撃グループ、悪性ドメインなど、セキュリティAIモデルの学習と性能改善に活用します。

セキュリティモデルの性能検証
MODEL VALIDATION

セキュリティモデルの性能検証

検証済みのデータセットを活用し、AIモデルの検知性能と実効性を定量的に評価します。

脅威インテリジェンス分析
THREAT INTELLIGENCE

脅威インテリジェンス分析

IoCと攻撃グループ、キャンペーン、TTPを連結し、単純な指標より豊かな脅威の文脈を分析できます。

企業・機関のセキュリティR&D
SECURITY R&D

企業・機関のセキュリティR&D

新しいAIセキュリティモデル、脅威分析技術、自動化研究のための基盤データとして活用できます。

AI R&D CAPABILITY

データを作り、AIで検証し、 再びセキュリティ技術へつなげます。

01 — CYBERSECURITY DOMAIN

サイバーセキュリティ専門企業

一般的なデータ専門企業ではなく、実際のサイバー脅威を分析してきたセキュリティ企業です。

02 — PROPRIETARY DATA FOUNDATION

自社の脅威データ基盤

大規模な自社脅威プロファイリングデータに基づく自社脅威インテリジェンスプラットフォームと分析データをもとにデータを構築できます。

03 — AI MODEL ENGINEERING

AIモデル研究開発力

構築したデータでAIモデルを直接学習・検証できる研究開発力を保有しています。

04 — END-TO-END EXPERIENCE

全プロセスの遂行経験

収集・加工・ラベリング・検証・保存・活用まで、全プロセスの遂行経験を保有しています。

FAQ

Cybersecurity AI Datasetについてよくある質問。

一般的なAI学習データと何が違うのですか?

サイバーセキュリティAIデータは単なるテキストや画像ではなく、マルウェア、IoC、攻撃グループ、攻撃手法、脆弱性など脅威間の関係と文脈が重要です。サンズラボは実際の脅威分析技術に基づき、セキュリティAIが学習できる特徴情報とラベルを構成します。

どのようなサイバーセキュリティ分野のデータを構築してきましたか?

2021〜2024年の公共部門事業を通じて、マルウェア、侵害事故、アプリケーションセキュリティ、能動型セキュリティ監視、脅威プロファイリング、脅威ハンティング、脅威インテリジェンス、最新の侵害事故など8つの領域でデータセット構築経験を保有しています。

データ品質はどのように検証しますか?

収集・加工・ラベリングの各段階でデータ品質を検査し、エラー分析と改善手続きを経ます。その後、構築したデータセットで実際のAIモデルを学習させ、Precision、Recall、F1-Scoreなどの性能指標を確認する方法でデータの実効性を検証します。

STIXのような標準フォーマットにも対応していますか?

公共部門事業では、JSONやSTIX 2.1などの構造化フォーマットを活用して脅威データを構成し、外部セキュリティシステムとの連携性を考慮したデータ構造を構築しました。

必要な目的に合わせて新しいデータセットを構築できますか?

サンズラボは、生の脅威データ収集から分析、メタデータ生成、ラベリング、品質検証、AIモデル検証まで、データパイプライン全体の構築経験を保有しています。実際の構築範囲は、研究目的やデータの権利、必要とされる脅威領域に応じて設計します。

このページのデータセットをそのまま購入できますか?

このページは特定の商用データセット商品というより、サンズラボのサイバーセキュリティAIデータ構築・検証力を紹介するR&Dページです。データ提供、共同研究、構築協力の可能範囲は、データの権利や事業条件に応じて別途協議します。

セキュリティAIに必要なデータから 一緒に設計します。

サイバー脅威データの収集・加工・ラベリングから品質検証、AIモデルの実証まで、サンズラボのデータ・AI研究力を活用してみてください。

このプロダクト、自社の環境ではどう動くのか。

デモ・評価・導入、どの段階にいても、サンズラボのソリューションエンジニアに直接おつなぎします。契約の前に、気になることをすべて確認してください。

FOR EVALUATORS

プロダクト評価・PoC

実データに基づくPoC、技術的な詳細検討、カスタム統合のスコープ策定まで。契約の前に、技術的な適合性を十分に検証できる状態を整えます。

FOR RESEARCHERS

技術協力・ライセンス

プロダクトを学術ベンチマークや共著論文で使いたい場合、研究ライセンスと元となるデータセットの提供を行います。公開論文の共著者としての参加も可能です。