searxng/searx/engines/qwant.py

"""
 Qwant (Web, Images, News, Social)

 @website     https://qwant.com/
 @provide-api not officially (https://api.qwant.com/api/search/)

 @using-api   yes
 @results     JSON
 @stable      yes
 @parse       url, title, content
"""

from datetime import datetime
from json import loads
from urllib.parse import urlencode
from searx.utils import html_to_text, match_language


# engine dependent config
categories = None
paging = True
language_support = True
supported_languages_url = 'https://qwant.com/region'

category_to_keyword = {'general': 'web',
                       'images': 'images',
                       'news': 'news',
                       'social media': 'social'}

# search-url
url = 'https://api.qwant.com/api/search/{keyword}?count=10&offset={offset}&f=&{query}&t={keyword}&uiv=4'


# do search-request
def request(query, params):
    offset = (params['pageno'] - 1) * 10

    if categories[0] and categories[0] in category_to_keyword:

        params['url'] = url.format(keyword=category_to_keyword[categories[0]],
                                   query=urlencode({'q': query}),
                                   offset=offset)
    else:
        params['url'] = url.format(keyword='web',
                                   query=urlencode({'q': query}),
                                   offset=offset)

    # add language tag
    if params['language'] != 'all':
        language = match_language(params['language'], supported_languages, language_aliases)
        params['url'] += '&locale=' + language.replace('-', '_').lower()

    params['headers']['User-Agent'] = 'Mozilla/5.0 (X11; Linux x86_64; rv:69.0) Gecko/20100101 Firefox/69.0'
    return params


# get response from search-request
def response(resp):
    results = []

    search_results = loads(resp.text)

    # return empty array if there are no results
    if 'data' not in search_results:
        return []

    data = search_results.get('data', {})

    res = data.get('result', {})

    # parse results
    for result in res.get('items', {}):

        title = html_to_text(result['title'])
        res_url = result['url']
        content = html_to_text(result['desc'])

        if category_to_keyword.get(categories[0], '') == 'web':
            results.append({'title': title,
                            'content': content,
                            'url': res_url})

        elif category_to_keyword.get(categories[0], '') == 'images':
            thumbnail_src = result['thumbnail']
            img_src = result['media']
            results.append({'template': 'images.html',
                            'url': res_url,
                            'title': title,
                            'content': '',
                            'thumbnail_src': thumbnail_src,
                            'img_src': img_src})

        elif category_to_keyword.get(categories[0], '') == 'social':
            published_date = datetime.fromtimestamp(result['date'], None)
            img_src = result.get('img', None)
            results.append({'url': res_url,
                            'title': title,
                            'publishedDate': published_date,
                            'content': content,
                            'img_src': img_src})

        elif category_to_keyword.get(categories[0], '') == 'news':
            published_date = datetime.fromtimestamp(result['date'], None)
            media = result.get('media', [])
            if len(media) > 0:
                img_src = media[0].get('pict', {}).get('url', None)
            else:
                img_src = None
            results.append({'url': res_url,
                            'title': title,
                            'publishedDate': published_date,
                            'content': content,
                            'img_src': img_src})

    return results


# get supported languages from their site
def _fetch_supported_languages(resp):
    # list of regions is embedded in page as a js object
    response_text = resp.text
    response_text = response_text[response_text.find('regionalisation'):]
    response_text = response_text[response_text.find('{'):response_text.find(');')]

    regions_json = loads(response_text)

    supported_languages = []
    for lang in regions_json['languages'].values():
        if lang['code'] == 'nb':
            lang['code'] = 'no'
        for country in lang['countries']:
            supported_languages.append(lang['code'] + '-' + country)

    return supported_languages
New Qwant engines - Web - Images - News - Social media 2015-05-31 22:00:32 +00:00			`"""`
Refactor Use only one engine for the four search from Qwant 2015-06-02 18:36:58 +00:00			`Qwant (Web, Images, News, Social)`
New Qwant engines - Web - Images - News - Social media 2015-05-31 22:00:32 +00:00
			`@website https://qwant.com/`
			`@provide-api not officially (https://api.qwant.com/api/search/)`

			`@using-api yes`
			`@results JSON`
			`@stable yes`
			`@parse url, title, content`
			`"""`

Refactor Use only one engine for the four search from Qwant 2015-06-02 18:36:58 +00:00			`from datetime import datetime`
[fix] remove html tags from qwant results 2016-12-10 20:27:47 +00:00			`from json import loads`
Drop Python 2 (1/n): remove unicode string and url_utils 2020-08-06 15:42:46 +00:00			`from urllib.parse import urlencode`
			`from searx.utils import html_to_text, match_language`

New Qwant engines - Web - Images - News - Social media 2015-05-31 22:00:32 +00:00
			`# engine dependent config`
Refactor Use only one engine for the four search from Qwant 2015-06-02 18:36:58 +00:00			`categories = None`
New Qwant engines - Web - Images - News - Social media 2015-05-31 22:00:32 +00:00			`paging = True`
			`language_support = True`
add language support for qwant closes issue #863 2017-02-25 02:21:48 +00:00			`supported_languages_url = 'https://qwant.com/region'`
New Qwant engines - Web - Images - News - Social media 2015-05-31 22:00:32 +00:00
Removed the keywords from the settings in qwant engine 2015-06-02 20:11:47 +00:00			`category_to_keyword = {'general': 'web',`
			`'images': 'images',`
			`'news': 'news',`
			`'social media': 'social'}`
Refactor Use only one engine for the four search from Qwant 2015-06-02 18:36:58 +00:00
New Qwant engines - Web - Images - News - Social media 2015-05-31 22:00:32 +00:00			`# search-url`
[fix] update qwant search url thx to @dalf for the fix (#1365) 2018-08-13 10:03:27 +00:00			`url = 'https://api.qwant.com/api/search/{keyword}?count=10&offset={offset}&f=&{query}&t={keyword}&uiv=4'`
New Qwant engines - Web - Images - News - Social media 2015-05-31 22:00:32 +00:00

			`# do search-request`
			`def request(query, params):`
			`offset = (params['pageno'] - 1) * 10`

Removed the keywords from the settings in qwant engine 2015-06-02 20:11:47 +00:00			`if categories[0] and categories[0] in category_to_keyword:`

			`params['url'] = url.format(keyword=category_to_keyword[categories[0]],`
			`query=urlencode({'q': query}),`
			`offset=offset)`
			`else:`
			`params['url'] = url.format(keyword='web',`
			`query=urlencode({'q': query}),`
			`offset=offset)`
New Qwant engines - Web - Images - News - Social media 2015-05-31 22:00:32 +00:00
remove 'all' option from search languages 2017-07-20 20:47:20 +00:00			`# add language tag`
Revert "remove 'all' option from search languages" This reverts commit 4d1770398a6af8902e75c0bd885781584d39e796. 2019-01-06 14:27:46 +00:00			`if params['language'] != 'all':`
			`language = match_language(params['language'], supported_languages, language_aliases)`
			`params['url'] += '&locale=' + language.replace('-', '_').lower()`
New Qwant engines - Web - Images - News - Social media 2015-05-31 22:00:32 +00:00
[fix] add explicit useragent header to requests - closes #1459 2019-12-21 19:25:39 +00:00			`params['headers']['User-Agent'] = 'Mozilla/5.0 (X11; Linux x86_64; rv:69.0) Gecko/20100101 Firefox/69.0'`
New Qwant engines - Web - Images - News - Social media 2015-05-31 22:00:32 +00:00			`return params`


			`# get response from search-request`
			`def response(resp):`
			`results = []`

			`search_results = loads(resp.text)`

			`# return empty array if there are no results`
			`if 'data' not in search_results:`
			`return []`

			`data = search_results.get('data', {})`

			`res = data.get('result', {})`

			`# parse results`
			`for result in res.get('items', {}):`

[fix] remove html tags from qwant results 2016-12-10 20:27:47 +00:00			`title = html_to_text(result['title'])`
New Qwant engines - Web - Images - News - Social media 2015-05-31 22:00:32 +00:00			`res_url = result['url']`
[fix] remove html tags from qwant results 2016-12-10 20:27:47 +00:00			`content = html_to_text(result['desc'])`
New Qwant engines - Web - Images - News - Social media 2015-05-31 22:00:32 +00:00
Removed the keywords from the settings in qwant engine 2015-06-02 20:11:47 +00:00			`if category_to_keyword.get(categories[0], '') == 'web':`
Refactor Use only one engine for the four search from Qwant 2015-06-02 18:36:58 +00:00			`results.append({'title': title,`
			`'content': content,`
			`'url': res_url})`

Removed the keywords from the settings in qwant engine 2015-06-02 20:11:47 +00:00			`elif category_to_keyword.get(categories[0], '') == 'images':`
Refactor Use only one engine for the four search from Qwant 2015-06-02 18:36:58 +00:00			`thumbnail_src = result['thumbnail']`
			`img_src = result['media']`
			`results.append({'template': 'images.html',`
			`'url': res_url,`
			`'title': title,`
			`'content': '',`
			`'thumbnail_src': thumbnail_src,`
			`'img_src': img_src})`

[mod] add/modify image fetching for bing_news, qwant and twitter engines 2017-02-12 13:58:49 +00:00			`elif category_to_keyword.get(categories[0], '') == 'social':`
Refactor Use only one engine for the four search from Qwant 2015-06-02 18:36:58 +00:00			`published_date = datetime.fromtimestamp(result['date'], None)`
[mod] add/modify image fetching for bing_news, qwant and twitter engines 2017-02-12 13:58:49 +00:00			`img_src = result.get('img', None)`
			`results.append({'url': res_url,`
			`'title': title,`
			`'publishedDate': published_date,`
			`'content': content,`
			`'img_src': img_src})`
Refactor Use only one engine for the four search from Qwant 2015-06-02 18:36:58 +00:00
[mod] add/modify image fetching for bing_news, qwant and twitter engines 2017-02-12 13:58:49 +00:00			`elif category_to_keyword.get(categories[0], '') == 'news':`
			`published_date = datetime.fromtimestamp(result['date'], None)`
			`media = result.get('media', [])`
			`if len(media) > 0:`
			`img_src = media[0].get('pict', {}).get('url', None)`
			`else:`
			`img_src = None`
Refactor Use only one engine for the four search from Qwant 2015-06-02 18:36:58 +00:00			`results.append({'url': res_url,`
			`'title': title,`
			`'publishedDate': published_date,`
[mod] add/modify image fetching for bing_news, qwant and twitter engines 2017-02-12 13:58:49 +00:00			`'content': content,`
			`'img_src': img_src})`
New Qwant engines - Web - Images - News - Social media 2015-05-31 22:00:32 +00:00
			`return results`
add language support for qwant closes issue #863 2017-02-25 02:21:48 +00:00

			`# get supported languages from their site`
			`def _fetch_supported_languages(resp):`
			`# list of regions is embedded in page as a js object`
			`response_text = resp.text`
			`response_text = response_text[response_text.find('regionalisation'):]`
			`response_text = response_text[response_text.find('{'):response_text.find(');')]`

			`regions_json = loads(response_text)`

			`supported_languages = []`
			`for lang in regions_json['languages'].values():`
make search language handling less strict languages.py can change, so users may query on a language that is not on the list anymore, even if it is still recognized by a few engines. also made no and nb the same because they seem to return the same, though most engines will only support one or the other. 2017-03-01 23:11:51 +00:00			`if lang['code'] == 'nb':`
			`lang['code'] = 'no'`
add language support for qwant closes issue #863 2017-02-25 02:21:48 +00:00			`for country in lang['countries']:`
			`supported_languages.append(lang['code'] + '-' + country)`

			`return supported_languages`