Skip to content
Projects
Groups
Snippets
Help
Loading...
Help
Submit feedback
Sign in / Register
Toggle navigation
A
aidso-data
Project
Project
Details
Activity
Releases
Cycle Analytics
Repository
Repository
Files
Commits
Branches
Tags
Contributors
Graph
Compare
Charts
Issues
0
Issues
0
List
Board
Labels
Milestones
Merge Requests
0
Merge Requests
0
CI / CD
CI / CD
Pipelines
Jobs
Schedules
Charts
Wiki
Wiki
Snippets
Snippets
Members
Members
Collapse sidebar
Close sidebar
Activity
Graph
Charts
Create a new issue
Jobs
Commits
Issue Boards
Open sidebar
Yaowentong
aidso-data
Commits
061b6795
Commit
061b6795
authored
Jun 30, 2026
by
Yaowentong
Browse files
Options
Browse Files
Download
Email Patches
Plain Diff
元宝修复
parent
07661504
Changes
3
Show whitespace changes
Inline
Side-by-side
Showing
3 changed files
with
28 additions
and
6 deletions
+28
-6
spider_save_tos.py
aidso_geo/models/spider_save_tos.py
+20
-2
yuanbao_android_data_process.py
aidso_geo/models/yuanbao_android_data_process.py
+2
-1
yuanbao_data_process.py
aidso_geo/models/yuanbao_data_process.py
+6
-3
No files found.
aidso_geo/models/spider_save_tos.py
View file @
061b6795
...
...
@@ -99,6 +99,22 @@ def yuanbao_android_process_rich_media(url_list):
quto_list
.
append
(
raw_data
)
return
quto_list
def
yuanbao_process_rich_media
(
url_list
):
quto_list
=
[]
for
item
in
url_list
:
video_id
=
item
.
get
(
'mediaId'
,
''
)
raw_data
=
{
"video_id"
:
video_id
,
"video_captions"
:
item
.
get
(
'title'
,
''
),
"video_first_frame_image"
:
item
.
get
(
'url'
,
''
)
or
item
.
get
(
'resourceUrl'
)
or
''
,
"main_site_url"
:
''
,
"source_app_name"
:
'视频号'
}
quto_list
.
append
(
raw_data
)
return
quto_list
def
doubao_process_rich_media
(
url_list
):
quto_list
=
[]
...
...
@@ -273,7 +289,7 @@ def yuanbao_process_quote(url_list):
"snippet"
:
item
.
get
(
'quote'
,
''
),
"index"
:
item
.
get
(
'index'
,
''
),
"published_at"
:
item
.
get
(
'publish_time'
,
''
),
"site_name"
:
item
.
get
(
'web_site_name'
,
''
),
"site_name"
:
item
.
get
(
'web_site_name'
,
''
)
or
item
.
get
(
'webSiteSource'
,
''
)
,
"site_icon"
:
item
.
get
(
'icon_url'
,
''
),
}
quto_list
.
append
(
raw_data
)
...
...
@@ -289,7 +305,7 @@ def yuanbao_android_process_quote(url_list):
"snippet"
:
item
.
get
(
'quote'
,
''
),
"index"
:
item
.
get
(
'index'
,
''
),
"published_at"
:
item
.
get
(
'publish_time'
,
''
),
"site_name"
:
item
.
get
(
'web_site_name'
,
''
),
"site_name"
:
item
.
get
(
'web_site_name'
,
''
)
or
item
.
get
(
'webSiteSource'
,
''
)
,
"site_icon"
:
item
.
get
(
'icon_url'
,
''
),
}
quto_list
.
append
(
raw_data
)
...
...
@@ -445,6 +461,8 @@ def save_data_to_tos(target_dir, content, file_name):
content
=
qianwen_process_rich_media
(
content
)
if
platform
==
'TXYBA'
:
content
=
yuanbao_android_process_rich_media
(
content
)
if
platform
==
'TXYB'
:
content
=
yuanbao_process_rich_media
(
content
)
if
file_name
==
"quote.txt"
:
if
platform
==
'DB'
:
...
...
aidso_geo/models/yuanbao_android_data_process.py
View file @
061b6795
...
...
@@ -35,6 +35,7 @@ def yuanbao_android_process_original_data(data):
except
(
IndexError
,
json
.
JSONDecodeError
):
continue
# 跳过格式错误的数据
if
json_data
.
get
(
'type'
)
==
'searchGuid'
:
url_list
=
json_data
.
get
(
'docs'
)
if
json_data
.
get
(
'type'
)
==
'think'
:
think_content
+=
json_data
.
get
(
'content'
)
...
...
@@ -107,7 +108,7 @@ if __name__ == '__main__':
# yuanbao_android_process_original_data(file_path2)
data_list
=
bh_utils
.
query_data
(
f
"select * from geo_commit_task where taskId = '
539a80f8-cd2d-4ae7-a45c-2b2d41fa738e
' and platform = 'TXYBA'"
)
data_list
=
bh_utils
.
query_data
(
f
"select * from geo_commit_task where taskId = '
30fde623-70a3-4ca7-86fb-393b60841402
' and platform = 'TXYBA'"
)
# # #
# # #
...
...
aidso_geo/models/yuanbao_data_process.py
View file @
061b6795
...
...
@@ -30,7 +30,6 @@ def yuanbao_process_original_data(data):
# 提取并解析JSON数据
data_str
=
i
.
split
(
"data: "
)[
1
]
json_data
=
json
.
loads
(
data_str
)
except
(
IndexError
,
json
.
JSONDecodeError
):
continue
# 跳过格式错误的数据
...
...
@@ -49,8 +48,12 @@ def yuanbao_process_original_data(data):
# response_content += json_data.get('contents')[0].get('msg')
if
json_data
.
get
(
'type'
)
==
'image'
:
response_content
=
"生成了图片"
if
json_data
.
get
(
'type'
)
==
'replace'
:
if
json_data
.
get
(
'replace'
)
.
get
(
'display'
)
==
'videoBoxV2'
:
rich_media_block
.
extend
(
json_data
.
get
(
'replace'
)
.
get
(
'multimedias'
))
spider_save_tos
.
process_and_save_files
(
file_path
,
search_keyword
,
url_list
,
think_content
,
response_content
,
suggestions
)
suggestions
,
rich_media_block
)
return
(
file_path
,
search_keyword
,
url_list
,
think_content
,
response_content
,
suggestions
)
except
Exception
as
e
:
parts
=
file_path
.
split
(
'/'
)
...
...
@@ -76,7 +79,7 @@ def yuanbao_process_original_data(data):
return
(
file_path
,
search_keyword
,
url_list
,
think_content
,
response_content
,
suggestions
)
if
__name__
==
'__main__'
:
data_list
=
bh_utils
.
query_data
(
f
"select * from geo_commit_task where taskId = '
69189ba0-e443-4e7c-a465-cabc07973540
' and platform = 'TXYB'"
)
data_list
=
bh_utils
.
query_data
(
f
"select * from geo_commit_task where taskId = '
30fde623-70a3-4ca7-86fb-393b60841402
' and platform = 'TXYB'"
)
# # #
# # #
...
...
Write
Preview
Markdown
is supported
0%
Try again
or
attach a new file
Attach a file
Cancel
You are about to add
0
people
to the discussion. Proceed with caution.
Finish editing this message first!
Cancel
Please
register
or
sign in
to comment