[tvp] Update tests and improve output

pull/4682/head
Philipp Hagemeister 10 years ago
parent ff21a8e0ee
commit fb4b030aaf

@ -8,19 +8,9 @@ from .common import InfoExtractor
class TvpIE(InfoExtractor): class TvpIE(InfoExtractor):
IE_NAME = 'tvp.pl' IE_NAME = 'tvp.pl'
_VALID_URL = r'https?://(?P<type>vod|www)\.tvp\.pl/.*/(?P<id>\d+)$' _VALID_URL = r'https?://(?:vod|www)\.tvp\.pl/.*/(?P<id>\d+)$'
_TESTS = [ _TESTS = [{
{
'url': 'http://www.tvp.pl/warszawa/magazyny/campusnews/wideo/31102013/12878238',
'info_dict': {
'id': '12878238',
'ext': 'wmv',
'title': 'CAMPUSnews, 31.10.2013 - Odcinek 2',
'description': '',
},
'skip': 'Download has to use same server IP as extraction. Therefore, a good (load-balancing) DNS resolver will make the download fail.',
}, {
'url': 'http://vod.tvp.pl/filmy-fabularne/filmy-za-darmo/ogniem-i-mieczem/wideo/odc-2/4278035', 'url': 'http://vod.tvp.pl/filmy-fabularne/filmy-za-darmo/ogniem-i-mieczem/wideo/odc-2/4278035',
'info_dict': { 'info_dict': {
'id': '4278035', 'id': '4278035',
@ -28,22 +18,20 @@ class TvpIE(InfoExtractor):
'title': 'Ogniem i mieczem, odc. 2', 'title': 'Ogniem i mieczem, odc. 2',
'description': 'Bohun dowiaduje się o złamaniu przez kniahinię danego mu słowa i wyrusza do Rozłogów. Helenie w ostatniej chwili udaje się uciec dzięki pomocy Zagłoby.', 'description': 'Bohun dowiaduje się o złamaniu przez kniahinię danego mu słowa i wyrusza do Rozłogów. Helenie w ostatniej chwili udaje się uciec dzięki pomocy Zagłoby.',
}, },
'skip': 'As above',
}, { }, {
'url': 'http://vod.tvp.pl/seriale/obyczajowe/czas-honoru/sezon-1-1-13/i-seria-odc-13/194536', 'url': 'http://vod.tvp.pl/seriale/obyczajowe/czas-honoru/sezon-1-1-13/i-seria-odc-13/194536',
'info_dict': { 'info_dict': {
'id': '194536', 'id': '194536',
'ext': 'mp4', 'ext': 'mp4',
'title': 'Czas honoru, I seria odc. 13', 'title': 'Czas honoru, I seria odc. 13',
'description': 'WŁADEK\nCzesław prosi Marię o dostarczenie Władkowi zarazki tyfusu. Jeśli zachoruje zostanie przewieziony do szpitala skąd łatwiej będzie go odbić. Czy matka zdecyduje się zarazić syna? Karol odwiedza Wandę przyznaje się, że ją oszukiwał, ale ostrzega też, że grozi jej aresztowanie i nalega, żeby wyjechała z Warszawy. Czy dziewczyna zdecyduje się znów oddalić od ukochanego? Rozpoczyna się akcja odbicia Władka.', # 'description': 'WŁADEK\nCzesław prosi Marię o dostarczenie Władkowi zarazki tyfusu. Jeśli zachoruje zostanie przewieziony do szpitala skąd łatwiej będzie go odbić. Czy matka zdecyduje się zarazić syna? Karol odwiedza Wandę przyznaje się, że ją oszukiwał, ale ostrzega też, że grozi jej aresztowanie i nalega, żeby wyjechała z Warszawy. Czy dziewczyna zdecyduje się znów oddalić od ukochanego? Rozpoczyna się akcja odbicia Władka.',
}, },
}, { }, {
'url': 'http://www.tvp.pl/there-can-be-anything-so-i-shortened-it/17916176', 'url': 'http://www.tvp.pl/there-can-be-anything-so-i-shortened-it/17916176',
'info_dict': { 'info_dict': {
'id': '17916176', 'id': '17916176',
'ext': 'mp4', 'ext': 'mp4',
'title': 'rozmaitosci, TVP Gorzów pokaże filmy studentów z podroży dookoła świata', 'title': 'TVP Gorzów pokaże filmy studentów z podroży dookoła świata',
'description': '',
}, },
'params': { 'params': {
# m3u8 download # m3u8 download
@ -61,26 +49,21 @@ class TvpIE(InfoExtractor):
# m3u8 download # m3u8 download
'skip_download': 'true', 'skip_download': 'true',
}, },
}, }]
]
def _real_extract(self, url): def _real_extract(self, url):
mobj = re.match(self._VALID_URL, url) video_id = self._match_id(url)
video_id = mobj.group('id')
webpage = self._download_webpage( webpage = self._download_webpage(
'http://www.tvp.pl/sess/tvplayer.php?object_id=%s' % video_id, video_id) 'http://www.tvp.pl/sess/tvplayer.php?object_id=%s' % video_id, video_id)
title = self._og_search_title(webpage) title = self._og_search_title(webpage)
series = self._search_regex( series = self._search_regex(
r'{name:\s*([\'"])SeriesTitle\1,\s*value:\s*\1(?P<series>.*?)\1},', r'{name:\s*([\'"])SeriesTitle\1,\s*value:\s*\1(?P<series>.*?)\1},',
webpage, 'series', group='series', default=None) webpage, 'series', group='series', default=None)
if series is not None and series not in title: if series is not None and series not in title:
title = '%s, %s' % (series, title) title = '%s, %s' % (series, title)
info_dict = { description = self._og_search_description(webpage, default=None)
'id': video_id,
'title': title,
'thumbnail': self._og_search_thumbnail(webpage),
'description': self._og_search_description(webpage),
}
video_url = self._search_regex( video_url = self._search_regex(
r'0:{src:([\'"])(?P<url>.*?)\1', webpage, 'formats', group='url', default=None) r'0:{src:([\'"])(?P<url>.*?)\1', webpage, 'formats', group='url', default=None)
if video_url is None: if video_url is None:
@ -92,25 +75,31 @@ class TvpIE(InfoExtractor):
if ext != 'ism/manifest': if ext != 'ism/manifest':
if '/' in ext: if '/' in ext:
ext = 'mp4' ext = 'mp4'
info_dict.update({ formats = [{
'ext': ext, 'format_id': 'direct',
'url': video_url, 'url': video_url,
}) 'ext': ext,
}]
else: else:
m3u8_url = re.sub('([^/]*)\.ism/manifest', r'\1.ism/\1.m3u8', video_url) m3u8_url = re.sub('([^/]*)\.ism/manifest', r'\1.ism/\1.m3u8', video_url)
formats = self._extract_m3u8_formats(m3u8_url, video_id, 'mp4') formats = self._extract_m3u8_formats(m3u8_url, video_id, 'mp4')
info_dict.update({
self._sort_formats(formats)
return {
'id': video_id,
'title': title,
'thumbnail': self._og_search_thumbnail(webpage),
'description': description,
'formats': formats, 'formats': formats,
}) }
return info_dict
class TvpSeriesIE(InfoExtractor): class TvpSeriesIE(InfoExtractor):
IE_NAME = 'tvp.pl:Series' IE_NAME = 'tvp.pl:Series'
_VALID_URL = r'https?://vod\.tvp\.pl/(?:[^/]+/){2}(?P<id>[^/]+)/?$' _VALID_URL = r'https?://vod\.tvp\.pl/(?:[^/]+/){2}(?P<id>[^/]+)/?$'
_TESTS = [ _TESTS = [{
{
'url': 'http://vod.tvp.pl/filmy-fabularne/filmy-za-darmo/ogniem-i-mieczem', 'url': 'http://vod.tvp.pl/filmy-fabularne/filmy-za-darmo/ogniem-i-mieczem',
'info_dict': { 'info_dict': {
'title': 'Ogniem i mieczem', 'title': 'Ogniem i mieczem',
@ -124,23 +113,26 @@ class TvpSeriesIE(InfoExtractor):
'id': '9329207', 'id': '9329207',
}, },
'playlist_count': 86, 'playlist_count': 86,
} }]
]
def _real_extract(self, url): def _real_extract(self, url):
display_id = self._match_id(url) display_id = self._match_id(url)
webpage = self._download_webpage(url, display_id, tries=5) webpage = self._download_webpage(url, display_id, tries=5)
title = self._html_search_regex( title = self._html_search_regex(
r'(?s) id=[\'"]path[\'"]>(?:.*? / ){2}(.*?)</span>', webpage, 'series') r'(?s) id=[\'"]path[\'"]>(?:.*? / ){2}(.*?)</span>', webpage, 'series')
playlist_id = self._search_regex(r'nodeId:\s*(\d+)', webpage, 'playlist id') playlist_id = self._search_regex(r'nodeId:\s*(\d+)', webpage, 'playlist id')
playlist = self._download_webpage( playlist = self._download_webpage(
'http://vod.tvp.pl/vod/seriesAjax?type=series&nodeId=%s&recommend' 'http://vod.tvp.pl/vod/seriesAjax?type=series&nodeId=%s&recommend'
'edId=0&sort=&page=0&pageSize=10000' % playlist_id, display_id, tries=5) 'edId=0&sort=&page=0&pageSize=10000' % playlist_id, display_id, tries=5,
note='Downloading playlist')
videos_paths = re.findall( videos_paths = re.findall(
'(?s)class="shortTitle">.*?href="(/[^"]+)', playlist) '(?s)class="shortTitle">.*?href="(/[^"]+)', playlist)
entries = [ entries = [
self.url_result('http://vod.tvp.pl%s' % v_path, ie=TvpIE.ie_key()) self.url_result('http://vod.tvp.pl%s' % v_path, ie=TvpIE.ie_key())
for v_path in videos_paths] for v_path in videos_paths]
return { return {
'_type': 'playlist', '_type': 'playlist',
'id': playlist_id, 'id': playlist_id,

Loading…
Cancel
Save