J'essaie d'extraire des informations de cette page . La page charge 10 éléments à la fois, et je dois faire défiler pour charger toutes les entrées (pour un total de 100). Je suis capable d'analyser le HTML et d'obtenir les informations dont j'ai besoin pour les 10 premières entrées, mais je veux charger complètement toutes les entrées avant d'analyser le HTML.
J'utilise python, requêtes et BeautifulSoup. La façon dont j'analyse la page lorsqu'elle se charge avec les 10 premières entrées est la suivante:
from bs4 import BeautifulSoup
import requests
s = requests.Session()
r = s.get('https://medium.com/top-100/december-2013')
page = BeautifulSoup(r.text)
Mais cela ne charge que les 10 premières entrées. J'ai donc regardé la page et j'ai obtenu la demande AJAX utilisée pour charger les entrées suivantes et j'obtiens une réponse mais elle est dans le JSON funky et je préfère utiliser l'analyseur HTML au lieu d'analyser JSON. Voici le code:
from bs4 import BeautifulSoup
import requests
import json
s = requests.Session()
url = 'https://medium.com/top-100/december-2013/load-more'
payload = {"count":100}
r = s.post(url, data=payload)
page = json.loads(r.text[16:]) #skip some chars that throw json off
Cela me donne les données mais c'est dans un JSON très long et alambiqué, je préférerais de loin charger toutes les données sur la page et simplement analyser le HTML. De plus, le HTML rendu fournit plus d'informations que la réponse JSON (c'est-à-dire le nom de l'auteur au lieu de l'ID utilisateur obscur, etc.) Il y avait une question similaire ici mais pas de réponses pertinentes. Idéalement, je veux faire l'appel POST et puis demander le code HTML et l'analyser, mais je n'ai pas été capable de le faire.
Cela, vous ne pourrez pas le faire avec les demandes et BeautifulSoup comme page dont vous souhaitez extraire les informations à partir du chargement des autres entrées via JS lorsque vous faites défiler vers le bas. Vous pouvez le faire en utilisant Selenium qui ouvre un véritable navigateur et vous pouvez transmettre des événements de pression de touche par page vers le bas par programme. Regardez cette vidéo pour voir l'action. http://www.youtube.com/watch?v=g54xYVMojos
http://www.tidbitsofprogramming.com/2014/02/crawling-website-that-loads-content.html
Vous trouverez ci-dessous le script qui extrait les 100 titres de publication à l'aide de Selenium.
import time
from Selenium import webdriver
from Selenium.webdriver.common.keys import Keys
browser = webdriver.Chrome()
browser.get("https://medium.com/top-100/december-2013")
time.sleep(1)
elem = browser.find_element_by_tag_name("body")
no_of_pagedowns = 20
while no_of_pagedowns:
elem.send_keys(Keys.PAGE_DOWN)
time.sleep(0.2)
no_of_pagedowns-=1
post_elems = browser.find_elements_by_class_name("post-item-title")
for post in post_elems:
print post.text
Production:
When Your Mother Says She’s Fat
When “Life Hacking” Is Really White Privilege
As tendências culturais dos anos 2000 adiantadas pelo É o Tchan na década de 90
Coming Out as Biracial
Como ganhar discussões com seus parentes de direita neste Natal
How to save local bookstores in two easy steps
Welcome to Dinovember
How to Piss Off Your Barista
The boy whose brain could unlock autism
CrossFit’s Dirty Little Secret
Welcome to Medium
Here’s How the Military Wasted Your Money in 2013
Why I Wear Nail Polish
The day of High School I’ll never forget
7 Reasons Buffalonians Shouldn’t Hate Snow
Dear Guy Who Just Made My Burrito:
Is the Mona Lisa Priceless?
Please stop live tweeting people’s private conversations
Your Friends and Rapists
Eight things you can live without
The Value of Content
40 Ways To Make Life Simple Again
Manila-Beijing-Washington:
Things I Wish Someone Had Told Me When I Was Learning How to Code
Dear Ticketmaster,
Steve Jobs Danced To My Song
11 Things I Wish I Knew When I Started My Business
Bullish: Benevolent Sexism and “That Guy” Who Makes Everything Awkward
Advice to a College Music Student
Silver Gyninen joutui sotaan
Imagining the Post-Antibiotics Future
Which side are you on?
Put it away, junior.
Casual Predation
The sad little iPhone commercial
How Node.js is Going to Replace JavaScript
Why you should have your heart broken into a million little pieces.
How to Write Emails Like a CEO
Designing Products That Scale
How radioactive poison became the assassin’s weapon of choice
Why do people hate CrossFit?
We (Still) Need Feminism
10 Advanced Hearthstone Arena Tips
Let It Full-Bleed
What Medium Is For
How a Small Force of Finnish Ski Troops Fought Off a Massive Soviet Army
An Introvert’s Guide to Better Presentations
Mandela The Terrorist
Why You Should have a Messy Desk
Why I’m Not a TEDx Speaker
Fonts have feelings too
You Don’t Want Your Thanksgiving to Go Like This
What I’ve Learned in My First Month as a VC
Why Quantity Should be Your Priority
My Airbnb story
I Wanna Date You Like An Animal
The GIF Guide to Getting Paid
How We Discovered the Underground Chinese App Market
First Images of a Heart Injected with Liquid Metal
Beyonce Broke the Music Business
“View mode” approach to responsive web design
Sometimes You Will Forget Your Mom Has Cancer
Darkness Ray Beams Invisibility From A Distance
Why Work As We Know It May Be Immoral
Staying Ahead of the Curve
The Geekiest Game Ever Made Has Been Released In Germany
The Dirty Secret Behind the Salesforce $1M Hackathon
I’m a really good impostor
Mathematical Model of Zombie Epidemics Reveals Two Types of Living-Dead Infections
The Heartbreak Kid
200 Things
I’m Not Racist But—
Duel of the Superbattleships
23 and You
The Seattle NO
I’m a vaccine refuser. There, I said it.
The Year We Broke Everything
How to make a DIY home alarm system with a Raspberry Pi and a webcam
Strike While the App is Hot
How to Fall In (and Out) of Love:
Why did Google make an ad for promoting “Search” in India where it has over 97% market share?
A Holiday Message From Jesus
Revealed: The Soviet Union’s $1 Billion ‘Psychotronic’ Arms Race with the US
Postmortem of a Venture-backed Startup
The 1.x Crore Myth
The “Getting Shit Done” Sleep Cycle
Is the F-35 Joint Strike Fighter the New F-4?
Can the F-35 Win a Dogfight?
Responsive Photosets
Fightball: Millennials vs Boomers
The iconicity of “peaceful resistance”
How We Make Chocolate
Five Ships of the Chinese Navy You Really Ought to Know About
Glassholes and Black Rock City
Bad News for U.S. Warplane Pilots: Russia’s New Dogfighting Missile Can’t Miss
How Antisec Died
10 ways you’ll probably f**k up your startup
UPDATED: Finding the unjustly homeless, and teaching them to code.
Technology hasn’t Changed Us.
What I’ve learned from fatherhood
Vous pouvez essayer avec ceci:
from Selenium import webdriver
from bs4 import BeautifulSoup
from Selenium.webdriver.support.ui import WebDriverWait
pause = 10
driver = webdriver.PhantomJS(executable_path='phantomjs.exe')
driver.get("your_url")
#This code will scroll down to the end
while True:
try:
# Action scroll down
driver.execute_script("window.scrollTo(0, document.body.scrollHeight);")
break
except:
pass
Alternativement, vous pouvez essayer la réponse donnée par Andrew Che dans cette question . Il s'agit d'une question vieille de 3 ans, et la page n'est plus là, mais si vous essayez quelque chose de similaire avec une page de résultats défilante (par exemple, j'ai recherché 'top'), vous pouvez trouver le point de terminaison que vous pouvez appeler pour obtenir les différentes pages de la liste des résultats, qui dans ce cas était ' https://medium.com/search/posts?q=top&page=1 '.