此示例是在 SQL Server 2016 中构建的,但它也应该适用于 MySQL 8.X。
我将事件日志数据存储在表 fact_user_event_activity 中,示例数据如下:
event_date_key user_key step_key session_id event_timestamp
20140411 123 1 1000 2014-04-11 08:00:00.000
20140411 123 2 1000 2014-04-11 08:10:00.000
20140411 123 3 1000 2014-04-11 08:20:00.000
20140411 123 4 1000 2014-04-11 08:30:00.000
20140411 125 1 1001 2014-04-11 09:10:00.000
20140411 123 5 1000 2014-04-11 08:31:00.000
20140411 125 2 1001 2014-04-11 09:30:00.000
20140411 125 3 1001 2014-04-11 09:50:00.000 <--
20140411 125 3 1001 2014-04-11 09:51:00.000 <--
20140411 125 4 1001 2014-04-11 09:52:00.000
假设:
2014-04-11 09:10:00.000 上的 user_key 125。预期
查询以下内容的最有效方法是什么?
user_key session_id step_1_duration_mins step_2_duration_mins step_3_duration_mins step_4_duration_mins
123 1000 10 10 10 1
125 1001 20 20 2 NULL
这将用作累积快照的 ETL 查询
设置
DROP TABLE IF EXISTS [fact_user_event_activity]
;
CREATE TABLE [fact_user_event_activity] (
[event_date_key] INT DEFAULT NULL,
[user_key] BIGINT NOT NULL,
[step_key] BIGINT NOT NULL,
[session_id] BIGINT NOT NULL,
[event_timestamp] datetime NOT NULL
)
;
INSERT INTO [fact_user_event_activity]
VALUES (20140411, 123, 1, 1000, N'2014-04-11 08:00:00'),
(20140411, 123, 2, 1000, N'2014-04-11 08:10:00'),
(20140411, 123, 3, 1000, N'2014-04-11 08:20:00'),
(20140411, 123, 4, 1000, N'2014-04-11 08:30:00'),
(20140411, 125, 1, 1001, N'2014-04-11 09:10:00'),
(20140411, 123, 5, 1000, N'2014-04-11 08:31:00'),
(20140411, 125, 2, 1001, N'2014-04-11 09:30:00'),
(20140411, 125, 3, 1001, N'2014-04-11 09:50:00'),
(20140411, 125, 3, 1001, N'2014-04-11 09:51:00'),
(20140411, 125, 4, 1001, N'2014-04-11 09:52:00'),
(20140411, 129, 1, 1005, N'2014-04-11 09:08:00'),
(20140411, 129, 2, 1005, N'2014-04-11 09:10:00'),
(20140411, 129, 3, 1005, N'2014-04-11 09:12:00'),
(20140411, 129, 3, 1005, N'2014-04-11 09:13:00'),
(20140411, 129, 4, 1005, N'2014-04-11 09:14:00'),
(20140411, 129, 5, 1005, N'2014-04-11 09:18:00')
;
我的尝试
为了便于理解代码,我分两步处理:
这会返回我所期望的结果,但我确定我可能会使事情过于复杂,并且这将与约 5 亿条记录相冲突,所以我想知道是否有更好的方法或者我是否遗漏了什么.
-- Step 1
-- to improve performance, use temp table instead of CTE
-- Use TIMESTAMPDIFF in MySQL instead of DATEDIFF
WITH durations_from_start_tmp AS
(
SELECT session_id, user_key, FIRST_VALUE(fuea.event_timestamp) OVER(PARTITION BY user_key, fuea.session_id ORDER BY fuea.event_timestamp) first_login,
DENSE_RANK() OVER(PARTITION BY user_key, step_key, fuea.session_id ORDER BY fuea.event_timestamp) AS rnk,
CASE WHEN step_key = 2 THEN DATEDIFF(MINUTE, FIRST_VALUE(fuea.event_timestamp) OVER(PARTITION BY user_key, fuea.session_id ORDER BY fuea.event_timestamp), fuea.event_timestamp) END AS step_1_duration_from_start,
CASE WHEN step_key = 3 THEN DATEDIFF(MINUTE, FIRST_VALUE(fuea.event_timestamp) OVER(PARTITION BY user_key, fuea.session_id ORDER BY fuea.event_timestamp), fuea.event_timestamp) END AS step_2_duration_from_start,
CASE WHEN step_key = 4 THEN DATEDIFF(MINUTE, FIRST_VALUE(fuea.event_timestamp) OVER(PARTITION BY user_key, fuea.session_id ORDER BY fuea.event_timestamp), fuea.event_timestamp) END AS step_3_duration_from_start,
CASE WHEN step_key = 5 THEN DATEDIFF(MINUTE, FIRST_VALUE(fuea.event_timestamp) OVER(PARTITION BY user_key, fuea.session_id ORDER BY fuea.event_timestamp), fuea.event_timestamp) END AS step_4_duration_from_start
FROM [fact_user_event_activity] fuea
--WHERE event_timestamp > watermark --for incremental load
)
-- Step 2
SELECT user_key, session_id, SUM(step_1_duration_from_start) AS step_1_duration_mins,
SUM(step_2_duration_from_start) - SUM(step_1_duration_from_start) AS step_2_duration_mins ,
SUM(step_3_duration_from_start) - SUM(step_2_duration_from_start) AS step_3_duration_mins ,
SUM(step_4_duration_from_start) - SUM(step_3_duration_from_start) AS step_4_duration_mins
FROM durations_from_start_tmp
-- deals with repeated steps
WHERE rnk = 1
GROUP BY user_key, session_id
引用资料
这可能与获得答案无关,但以防万一您不熟悉数据建模概念
最佳答案
因此,您可能采取的一种方法是添加一个索引(假设您可以添加一个),例如:
在 [fact_user_event_activity](user_key、session_id、step_key、event_timestamp)上创建索引 [SomeIndexName];
(或者,如果您担心 500m 行的索引大小,您可以在 step_key、event_timestamp 上做一个包含。)
然后跳过将窗口函数与如下查询一起使用:
SELECT user_key,
session_id,
step_1_duration = DATEDIFF(MINUTE, step_1_timestamp, step_2_timestamp),
step_2_duration = DATEDIFF(MINUTE, step_2_timestamp, step_3_timestamp),
step_3_duration = DATEDIFF(MINUTE, step_3_timestamp, step_4_timestamp),
step_4_duration = DATEDIFF(MINUTE, step_4_timestamp, step_5_timestamp)
FROM
(
SELECT user_key, session_id,
step_1_timestamp = MIN(CASE WHEN step_key = 1 THEN event_timestamp END),
step_2_timestamp = MIN(CASE WHEN step_key = 2 THEN event_timestamp END),
step_3_timestamp = MIN(CASE WHEN step_key = 3 THEN event_timestamp END),
step_4_timestamp = MIN(CASE WHEN step_key = 4 THEN event_timestamp END),
step_5_timestamp = MIN(CASE WHEN step_key = 5 THEN event_timestamp END)
FROM fact_user_event_activity
GROUP BY user_key, session_id
) AS T;
(理论上只进行索引扫描,不需要任何排序。)
关于mysql - 高效查询以从 sql 中的事件日志表获取步骤持续时间到累积快照事实,我们在Stack Overflow上找到一个类似的问题: https://stackoverflow.com/questions/56761769/
总的来说,我对ruby还比较陌生,我正在为我正在创建的对象编写一些rspec测试用例。许多测试用例都非常基础,我只是想确保正确填充和返回值。我想知道是否有办法使用循环结构来执行此操作。不必为我要测试的每个方法都设置一个assertEquals。例如:describeitem,"TestingtheItem"doit"willhaveanullvaluetostart"doitem=Item.new#HereIcoulddotheitem.name.shouldbe_nil#thenIcoulddoitem.category.shouldbe_nilendend但我想要一些方法来使用
我试图在一个项目中使用rake,如果我把所有东西都放到Rakefile中,它会很大并且很难读取/找到东西,所以我试着将每个命名空间放在lib/rake中它自己的文件中,我添加了这个到我的rake文件的顶部:Dir['#{File.dirname(__FILE__)}/lib/rake/*.rake'].map{|f|requiref}它加载文件没问题,但没有任务。我现在只有一个.rake文件作为测试,名为“servers.rake”,它看起来像这样:namespace:serverdotask:testdoputs"test"endend所以当我运行rakeserver:testid时
作为我的Rails应用程序的一部分,我编写了一个小导入程序,它从我们的LDAP系统中吸取数据并将其塞入一个用户表中。不幸的是,与LDAP相关的代码在遍历我们的32K用户时泄漏了大量内存,我一直无法弄清楚如何解决这个问题。这个问题似乎在某种程度上与LDAP库有关,因为当我删除对LDAP内容的调用时,内存使用情况会很好地稳定下来。此外,不断增加的对象是Net::BER::BerIdentifiedString和Net::BER::BerIdentifiedArray,它们都是LDAP库的一部分。当我运行导入时,内存使用量最终达到超过1GB的峰值。如果问题存在,我需要找到一些方法来更正我的代
Rails2.3可以选择随时使用RouteSet#add_configuration_file添加更多路由。是否可以在Rails3项目中做同样的事情? 最佳答案 在config/application.rb中:config.paths.config.routes在Rails3.2(也可能是Rails3.1)中,使用:config.paths["config/routes"] 关于ruby-on-rails-Rails3中的多个路由文件,我们在StackOverflow上找到一个类似的问题
我正在用Ruby编写一个简单的程序来检查域列表是否被占用。基本上它循环遍历列表,并使用以下函数进行检查。require'rubygems'require'whois'defcheck_domain(domain)c=Whois::Client.newc.query("google.com").available?end程序不断出错(即使我在google.com中进行硬编码),并打印以下消息。鉴于该程序非常简单,我已经没有什么想法了-有什么建议吗?/Library/Ruby/Gems/1.8/gems/whois-2.0.2/lib/whois/server/adapters/base.
我需要从一个View访问多个模型。以前,我的links_controller仅用于提供以不同方式排序的链接资源。现在我想包括一个部分(我假设)显示按分数排序的顶级用户(@users=User.all.sort_by(&:score))我知道我可以将此代码插入每个链接操作并从View访问它,但这似乎不是“ruby方式”,我将需要在不久的将来访问更多模型。这可能会变得很脏,是否有针对这种情况的任何技术?注意事项:我认为我的应用程序正朝着单一格式和动态页面内容的方向发展,本质上是一个典型的网络应用程序。我知道before_filter但考虑到我希望应用程序进入的方向,这似乎很麻烦。最终从任何
我在我的项目中添加了一个系统来重置用户密码并通过电子邮件将密码发送给他,以防他忘记密码。昨天它运行良好(当我实现它时)。当我今天尝试启动服务器时,出现以下错误。=>BootingWEBrick=>Rails3.2.1applicationstartingindevelopmentonhttp://0.0.0.0:3000=>Callwith-dtodetach=>Ctrl-CtoshutdownserverExiting/Users/vinayshenoy/.rvm/gems/ruby-1.9.3-p0/gems/actionmailer-3.2.1/lib/action_mailer
刚入门rails,开始慢慢理解。有人可以解释或给我一些关于在application_controller中编码的好处或时间和原因的想法吗?有哪些用例。您如何为Rails应用程序使用应用程序Controller?我不想在那里放太多代码,因为据我了解,每个请求都会调用此Controller。这是真的? 最佳答案 ApplicationController实际上是您应用程序中的每个其他Controller都将从中继承的类(尽管这不是强制性的)。我同意不要用太多代码弄乱它并保持干净整洁的态度,尽管在某些情况下ApplicationContr
我想向我的Controller传递一个参数,它是一个简单的复选框,但我不知道如何在模型的form_for中引入它,这是我的观点:{:id=>'go_finance'}do|f|%>Transferirde:para:Entrada:"input",:placeholder=>"Quantofoiganho?"%>Saída:"output",:placeholder=>"Quantofoigasto?"%>Nota:我想做一个额外的复选框,但我该怎么做,模型中没有一个对象,而是一个要检查的对象,以便在Controller中创建一个ifelse,如果没有检查,请帮助我,非常感谢,谢谢
我正在编写一个小脚本来定位aws存储桶中的特定文件,并创建一个临时验证的url以发送给同事。(理想情况下,这将创建类似于在控制台上右键单击存储桶中的文件并复制链接地址的结果)。我研究过回形针,它似乎不符合这个标准,但我可能只是不知道它的全部功能。我尝试了以下方法:defauthenticated_url(file_name,bucket)AWS::S3::S3Object.url_for(file_name,bucket,:secure=>true,:expires=>20*60)end产生这种类型的结果:...-1.amazonaws.com/file_path/file.zip.A