HtmlUnit无法获取页面 - javascript块

首先我想提一提，我是HtmlUnit的新手。我正在尝试获取网页并解析其内容。网址：https://secure.fattal.co.il/BE_Results.aspx?Lang=heb&In=2016-08-07&Out=2016-08-11&Region=2&Rooms=1&Ad1=2&Ch1=0&Inf1=0 HtmlUnit无法获取页面 - javascript块

但我结束了与下面的JavaScript内容：

<html><head><meta charset="utf-8"></head><body><script>window.rbzns = {fiftyeightkb: 43200000, days_in_week : 1};</script><script src="//d1a702rd0dylue.cloudfront.net/js/sugarman/v7/flat.js"></script><script>rbzns.challdomain=".fattal.co.il"; rbzns.ctrbg="NMdHaCamRWvRkFxSyeq856yW5EEmzuHN32UH9RoO3YoeT4HIU++m8k1QIpK0EQqM2RF/9vvBg5S4A3I18QPa4mRMEb+S4Fh3ZVljis2xiCe2tYg/zlUJMN5kVMgLQKw/mbEk8L77gcYBrz56tLIPxg==";rbzns.rbzreqid="fc167e1a3134363136353639343033970795be87d166"; winsocks(true);</script></body></html>

注：我开始使用取jsoup解析器的URL，但反应是相同的JavaScript。

在google搜索之后，我发现我应该使用像HtmlUnit这样的无头浏览器。

但即使使用HtmlUnit来获取页面，JavaScript内容又回来了。

下面是一小部分：

String url = "https://secure.fattal.co.il/BE_Results.aspx?Lang=heb&In=2016-08-07&Out=2016-08-11&Region=2&Rooms=1&Ad1=2&Ch1=0&Inf1=0"; // hard coded just for example 
webClient = new WebClient(); 

// Get the first page 
webClient.getOptions().setThrowExceptionOnFailingStatusCode(false); 

webClient.getOptions().setThrowExceptionOnScriptError(false); 
webClient.getOptions().setRedirectEnabled(true); 
webClient.setJavaScriptTimeout(100000); 
webClient.waitForBackgroundJavaScript(100000); 

page = webClient.getPage(url); 
System.out.println(page.getWebResponse().getContentAsString());

我寻遍了解决方案，没有任何具体的答案。

任何帮助将不胜感激

来源

2016-04-26 YyYo

好吧，我看着办吧。

JavaScript源代码我张贴：

<html><head><meta charset="utf-8"></head><body><script>window.rbzns = {fiftyeightkb: 43200000, days_in_week : 1};</script><script src="//d1a702rd0dylue.cloudfront.net/js/sugarman/v7/flat.js"></script><script>rbzns.challdomain=".fattal.co.il"; rbzns.ctrbg="NMdHaCamRWvRkFxSyeq856yW5EEmzuHN32UH9RoO3YoeT4HIU++m8k1QIpK0EQqM2RF/9vvBg5S4A3I18QPa4mRMEb+S4Fh3ZVljis2xiCe2tYg/zlUJMN5kVMgLQKw/mbEk8L77gcYBrz56tLIPxg==";rbzns.rbzreqid="fc167e1a3134363136353639343033970795be87d166"; winsocks(true);</script></body></html>

是检查是否要求来自于浏览器，而不是某种机器人或爬虫来到一个已知的脚本。由于HtmlUnit支持（部分）JavaScript，我已经改变了我的代码来使用Selenium.webdriver + phantomJS，它现在的工作就像一个魅力。

来源

2016-05-06 14:33:43 YyYo

HtmlUnit无法获取页面 - javascript块

回答

相关问题