了解搜索功能的数据可用性

支持的平台:

本文档详细介绍了数据注入生命周期,包括端到端数据传输和延迟时间,以及这些因素如何影响最近注入的数据在查询和分析方面的可用性。

在 Google SecOps 中注入和处理数据

本部分介绍了 Google SecOps 如何提取、处理和分析安全数据。

数据注入

数据注入流水线首先从以下来源收集原始安全数据:

  • 内部系统的安全日志
  • 存储在 Cloud Storage 中的数据
  • 安全运维中心 (SOC) 和其他内部系统

Google SecOps 会使用其安全注入方法之一将这些数据引入平台。

主要提取方法包括:

  • 直接 Google Cloud 提取

    Google SecOps 使用直接 Google Cloud 注入功能,自动从您组织的 Google Cloud中提取日志和遥测数据,包括 Cloud Logging、Cloud Asset Inventory 元数据和 Security Command Center 高级方案发现结果。

  • 提取 API

    使用 Google SecOps 的公共 REST Ingestion API 直接向其发送数据。您可以使用此方法进行自定义集成,也可以将数据作为非结构化日志或预先格式化的统一数据模型 (UDM) 事件发送。

  • Bindplane 代理

    您可以在环境(本地或其他云)中部署多功能的 Bindplane 代理,以从各种来源收集日志并将其转发到 Google SecOps。

  • 数据 Feed

    在 Google SecOps 中,您可以配置数据 Feed 以从第三方来源(例如特定的第三方云存储桶 [如 Amazon S3] 或第三方 API [如 Okta 或 Microsoft 365])提取日志。

规范化和数据丰富化

数据到达 Google SecOps 后,平台会通过以下阶段对其进行处理:

  1. 解析和标准化

    解析器首先处理原始日志数据,以验证、提取数据并将其从原始格式转换为标准化的 UDM。借助解析和归一化,您可以使用单个一致的架构来分析不同的数据源(例如,防火墙日志、端点数据、云日志)。原始原始日志仍与 UDM 事件一起存储。

  2. 索引编制

    标准化后,Google SecOps 会对 UDM 数据编制索引,以便在庞大的数据集中实现快速查询,从而使 UDM 事件可供搜索。

  3. UDM 别名和丰富化

    • Google SecOps 会执行 UDM 别名化和扩充,通过识别和添加日志实体的情境数据和指标,扩充 UDM 事件的情境信息。例如,它将用户的 login name 与其各种 IP addresses、hostnames 和 MAC addresses 相关联。
    • 地理定位:Google SecOps 会使用地理定位数据来丰富 IP 地址。
  4. 心电图丰富化

    • Google SecOps 会执行 ECG 别名化,将来自多个来源(例如 IdP、CMDB 和威胁情报)的上下文合并,以在实体上下文图中构建整合的实体配置文件。

    • 威胁情报:Google SecOps 会自动将事件数据与 Google 庞大的威胁情报(包括 Google Threat Intelligence 和 安全浏览 等来源)进行比较,以识别已知的恶意威胁,例如 domains、IP addresses 和 file hashes。

    • WHOIS:Google SecOps 会使用域名公开注册的 WHOIS 信息来扩充域名。

可用于分析的数据

经过处理和丰富后,UDM 数据可立即用于分析:

  • 实时检测

    检测引擎会自动针对实时传入的数据运行启用实时规则的自定义规则和 Google 内建规则,以识别威胁并生成提醒。

  • 搜索和调查

    分析师可以使用搜索方法来搜索所有这些经过归一化和丰富的数据。例如,使用 UDM 搜索在相关实体(例如 user、asset 和恶意 domain)之间切换,并调查提醒。

搜索方法

Google SecOps 提供了多种不同的数据搜索方法,每种方法都有不同的用途。

UDM 搜索是主要且最快的搜索方法,适用于大多数调查。

  • 搜索内容:它会查询已规范化并编入索引的 UDM 事件。由于所有数据都会解析为这种标准格式,因此您可以编写一个查询,在所有不同的产品(例如 Windows、Okta、Linux)中查找相同的活动(例如登录)。
  • 运作方式:您可以使用特定语法查询字段、运算符和值。
  • 示例: principal.hostname = "win-server" AND target.ip = "10.1.2.3"

    结果通常会在提取后 2-15 分钟内提供。

使用原始日志搜索功能可在未解析的原始日志消息中查找可能未映射到 UDM 字段的内容。此搜索方法针对高速搜索进行了优化,通常会在 2 秒内返回特定指示器(例如文件哈希或 IP 地址)的结果。

  • 搜索内容:它会扫描日志的原始未处理文本,然后再进行解析和规范化。这有助于查找未编入索引的特定字符串、命令行实参或其他制品。
  • 工作原理:您可以使用 raw = 前缀。它可能比 UDM 搜索慢,因为它不会搜索已编入索引的字段。
  • 示例(字符串): raw = "PsExec.exe"
  • 示例(正则表达式): raw = /admin\$/

使用统计搜索来分析汇总了数百万行数据的长期趋势。由于平台必须执行统计分析和分组,因此这些查询的加载时间会更长。

自然语言搜索 (Gemini)

借助自然语言搜索 (Gemini),您可以使用简单的英语提出问题,然后 Gemini 会将这些问题转换为正式的 UDM 查询。

  • 搜索内容:提供对话式界面,用于查询 UDM 数据。
  • 工作原理:您输入问题后,Gemini 会为您生成相应的 UDM 搜索查询,然后您可以运行或优化该查询。
  • 示例:“显示过去 24 小时内用户‘bob’的所有登录失败记录”

SOAR 搜索专门针对 SOAR 组件。您可以使用它来管理安全事件,而不是在日志中搜寻。

  • 搜索内容:在 SOAR 平台中搜索支持请求和实体(例如用户、资产、IP 地址)。
  • 工作原理:您可以使用自由文本过滤条件或基于字段的过滤条件来查找特定支持请求,例如按支持请求 ID、提醒名称、状态和分配的用户查找。
  • 示例:搜索 CaseIds:180 或 AlertName:Brute Force

数据注入流水线到搜索可用性

端到端数据可用性是指从事件发生到可在 Google SecOps 中用于搜索或执行规则的总时间。此延迟时间是以下两个组成部分的总和:

  1. 源端可用性延迟时间:事件发生时与源系统使日志数据可供提取时之间的时间。此延迟时间取决于源系统的架构、处理、批处理和 API 发布时间表。Google SecOps 无法影响此延迟。例如,当系统将日志写入存储桶或将其发布到 API 端点时,可能会出现延迟。

  2. Google SecOps 处理时间:Google SecOps 在收到数据后处理数据所需的时间。此时长包括内部流水线阶段,例如提取、解析、归一化、编入索引和丰富。

在排查数据可见性时间线问题时,您必须同时考虑这两个组件。

源自数据源的延迟

以下因素可能会影响来源端的可用性延迟:

  • 批处理:某些系统会按设定的时间间隔(例如每小时)批量生成日志。
  • API 延迟时间:源 API 在使新事件可供查询方面可能存在固有的延迟。
  • 活动创建和发布时间:日志中的活动时间戳可能比日志最终确定并可供收集的时间戳早得多。
  • 节流:来源端 API 速率限制可能会减慢数据检索速度。
  • 初始回填:传送和提取大量历史数据需要时间。

这些延迟时间因数据源和日志类型而异。如需详细了解注入方法,请参阅数据注入概览。Feed 管理 API 参考文档介绍了针对 Microsoft Graph、SentinelOne、Okta 和 CrowdStrike 等日志类型的具体注意事项。

Google SecOps 处理时间

系统会通过多个步骤处理新提取的数据。这些步骤的持续时间决定了新提取的数据何时可用于查询和分析。

下表按搜索方法细分了新注入数据的处理步骤。完成这些步骤后,新注入的数据即可供搜索。

搜索方法 正在搜索的数据 有助于提高可用时间的处理步骤
规范化和丰富化的 UDM 事件
  1. 注入:日志到达 Google SecOps 注入点。
  2. 解析:原始日志由其特定解析器识别和处理。
  3. 标准化:提取数据并将其映射到 UDM 架构。
  4. 编制索引 (UDM):已标准化的 UDM 记录会编制索引,以便进行快速的结构化搜索。
  5. 丰富:添加上下文(威胁情报、地理位置信息、用户或资产数据)。
原始日志搜索 原始的未解析日志文本
  1. 注入:日志到达 Google SecOps 注入点。
检测引擎(规则) 归一化事件
  1. UDM 事件可用性:与 UDM 搜索的步骤相同。
  2. 检测评估:规则引擎以“微批次”方式评估日志,通常会在事件到达后 5-10 分钟内触发检测。
SOAR 搜索 支持请求和实体 这是一个不同的生命周期,因为它搜索的是提醒和支持请求,而不是日志。时间基于:
  1. UDM 事件可用性:使用与“UDM 搜索”相同的处理步骤。
  2. 检测:检测引擎规则必须与 UDM 事件匹配。
  3. 生成提醒:系统会根据检测结果创建正式提醒。
  4. 创建支持请求:SOAR 平台注入警报并创建支持请求。

数据传输示例

以下示例展示了 Google SecOps 如何注入、处理、增强和分析您的安全数据,以便您进行搜索和进一步分析。

数据处理步骤示例

  1. 从 Amazon S3 等云服务或Google Cloud中检索安全数据。Google SecOps 会对传输中的数据进行加密。
  2. 将加密的安全数据分离并存储在您的账号中。只有您和少数 Google 人员(负责产品支持、开发和维护)有权访问这些数据。
  3. 解析并验证原始安全数据,使其更易于处理和查看。
  4. 对数据进行归一化和索引,以便快速搜索。
  5. 在您的账号中存储已解析和已编入索引的数据。
  6. 使用情境数据进行丰富。
  7. 为用户提供安全访问权限,以便用户搜索和查看自己的安全数据。
  8. 将您的安全数据与 Google Threat Intelligence 恶意软件数据库进行比较,以识别匹配项。在 Google SecOps 事件视图(例如“资产”视图)中,点击 VT 上下文即可查看 Google Threat Intelligence 信息。Google SecOps 不会与 Google Threat Intelligence 共享您的安全数据。

数据流向和处理方式 - Google SecOps

搜索功能预计可用时间示例

新注入的数据可用于搜索的预计时间是数据传输中各个流程时长的总和。

例如,从数据发送到 Google SecOps 提取服务开始,UDM 搜索中数据可用的典型平均时间约为 5 分 30 秒。

数据传输步骤 说明 流量时长
Cloud Storage 到原始日志 从 Cloud Storage 提取原始日志。 不到 30 秒
安全日志到数据转发服务 将安全日志从内部系统传输到平台。 不适用
数据转发服务到原始日志 将从各种来源接收的原始安全数据发送到注入流水线。 不到 30 秒
从原始日志到解析和验证 将原始日志解析并验证为 UDM 格式。 不到 3 分钟
解析和验证到索引 对已解析的 UDM 数据编制索引,以便快速搜索。 不适用
索引到已解析的客户数据 使已编入索引的数据可作为已解析的客户数据用于分析。 不到 2 分钟

问题排查

本部分提供问题排查指南。

延迟和限制

Google SecOps 平台中的处理和可视化延迟时间受以下架构限制(在 Google SecOps 收到数据后):

  • 搜索可见性:注入后 2 到 15 分钟。
  • 规则执行:在事件到达后 5 到 10 分钟。

需要更多帮助?获得社区成员和 Google SecOps 专业人士的解答。