深入理解与实现USDA FDC API数据分页获取

深入理解与实现usda fdc api数据分页获取

本文旨在解决通过Python API获取USDA FDC营养数据时遇到的结果限制问题。我们将详细讲解API分页机制,介绍如何利用pageSize和pageNumber参数,并通过迭代请求实现完整数据集的检索,确保用户能够高效、准确地获取所有目标数据。

1. 理解API分页机制

在使用第三方API时,特别是涉及大量数据检索的场景,API通常会采用分页(Pagination)机制来管理和限制单次请求返回的数据量。这种机制有几个主要目的:

减轻服务器压力: 避免一次性返回海量数据,消耗过多服务器资源。优化网络传输: 减少单次请求的数据传输量,提高响应速度。提升客户端性能: 客户端无需一次性处理所有数据,可以按需加载,提升用户体验。

对于USDA Food Data Central (FDC) API,默认情况下,其搜索接口(/foods/search)每次请求最多返回50条结果。如果未正确处理分页,用户将只能获取到数据集的冰山一角。

2. 识别API分页信息

要正确处理API分页,首先需要识别API响应中包含的分页信息。通常,API会在响应体中提供当前页码、总页数以及每页大小等关键信息。以USDA FDC API为例,当您发起一个搜索请求并获取到JSON响应时,会发现类似currentPage和totalPages这样的字段,它们明确指示了结果是分页的,并且提供了遍历所有页面所需的信息。

此外,查阅API官方文档是理解分页机制最直接有效的方式。USDA FDC API的文档会明确指出哪些参数用于控制分页,例如pageSize(每页返回结果数量)和pageNumber(请求的页码)。根据文档,pageSize的默认值是50,但最大可以设置为200。

3. 实现完整数据检索:分页请求策略

要获取所有符合条件的数据,我们需要实施一个迭代请求策略,即:

发起第一次请求,获取第一页数据,并识别总页数。根据总页数,循环发起后续请求,每次请求不同的页码。将所有页面的数据合并起来,形成完整的查询结果。

以下是一个使用Python requests库实现USDA FDC API分页数据检索的示例:

import requestsimport jsonimport pandas as pddef get_all_food_data(query_term: str, api_key: str, max_page_size: int = 200) -> list:    """    通过迭代请求USDA FDC API,获取指定查询词的所有食物营养数据。    Args:        query_term (str): 搜索的食物名称或关键词。        api_key (str): 您的USDA FDC API密钥。        max_page_size (int): 每页请求的最大结果数量,USDA FDC API最大支持200。    Returns:        list: 包含所有食物营养数据的列表,每个元素是一个字典。              如果请求失败或无数据,则返回空列表。    """    all_foods = []    # 构建基础URL,设置API密钥和查询词,并指定最大页大小    base_url = f"https://api.nal.usda.gov/fdc/v1/foods/search?api_key={api_key}&query={query_term}&pageSize={max_page_size}"    with requests.Session() as session:  # 使用requests.Session保持连接,提高效率        try:            # 1. 获取第一页数据,并确定总页数            print(f"Fetching page 1 for query: '{query_term}'...")            response = session.get(base_url, timeout=15)            response.raise_for_status()  # 检查HTTP请求是否成功            api_response = response.json()            if not api_response.get("foods"):                print(f"No foods found for query: '{query_term}'.")                return []            all_foods.extend(api_response["foods"])            total_pages = api_response.get("totalPages", 1)            print(f"Total pages to retrieve: {total_pages}")            # 2. 迭代获取后续页面数据            for page_num in range(2, total_pages + 1):                print(f"Fetching page {page_num}...")                page_url = f"{base_url}&pageNumber={page_num}"                page_response = session.get(page_url, timeout=15)                page_response.raise_for_status()                page_data = page_response.json()                all_foods.extend(page_data["foods"])        except requests.exceptions.HTTPError as http_err:            print(f"HTTP error occurred: {http_err} - Status Code: {response.status_code}")            return []        except requests.exceptions.ConnectionError as conn_err:            print(f"Connection error occurred: {conn_err}")            return []        except requests.exceptions.Timeout as timeout_err:            print(f"Timeout error occurred: {timeout_err}")            return []        except requests.exceptions.RequestException as req_err:            print(f"An unexpected error occurred: {req_err}")            return []        except json.JSONDecodeError:            print(f"Failed to decode JSON from response: {response.text[:200]}...")            return []    return all_foods# --- 示例使用 ---if __name__ == "__main__":    # 请替换为您的实际API密钥    YOUR_API_KEY = "YOUR_USDA_API_KEY"    search_query = "raw" # 例如,搜索所有“生”的食物    # 1. 获取所有食物数据    food_items = get_all_food_data(search_query, YOUR_API_KEY)    if food_items:        print(f"nSuccessfully retrieved {len(food_items)} food items.")        # 2. 将获取到的数据转换为DataFrame并进行处理        table_data = []        for food_item in food_items:            row = {                "Description": food_item.get("description", "N/A"),                "FDC_ID": food_item.get("fdcId", "N/A")            }            # 提取主要营养素            for nutrient in food_item.get("foodNutrients", []):                nutrient_name = nutrient.get("nutrientName")                if nutrient_name:                    row[nutrient_name] = nutrient.get("value")            table_data.append(row)        df = pd.DataFrame(table_data)        # 3. 数据清洗和处理(示例)        # 移除完全为空的列(如果有很多稀疏营养素)        df.dropna(axis=1, how='all', inplace=True)        # 填充NaN值,例如用0或平均值        df.fillna(0, inplace=True)        print("nDataFrame Head:")        print(df.head())        print(f"nDataFrame Shape: {df.shape}")        # 4. 导出到Excel        try:            output_filename = f'{search_query}_food_data.xlsx'            df.to_excel(output_filename, index=False)            print(f"nData successfully exported to '{output_filename}'")        except Exception as e:            print(f"Error exporting to Excel: {e}")    else:        print("No data to process or export.")

4. 代码解析与注意事项

requests.Session(): 使用requests.Session()可以有效地复用TCP连接,对于需要进行多次HTTP请求的场景(如分页),这能显著提高性能。pageSize参数: 在构建初始URL时,通过&pageSize=200将每页结果数量设置为最大值,以减少总请求次数。totalPages识别: 第一次请求后,从API响应中提取totalPages字段,这是控制循环的关键。循环迭代: 使用range(2, total_pages + 1)从第二页开始遍历到最后一页,每次请求通过&pageNumber={page_num}指定页码。数据合并: 每次请求获取到的foods列表都通过all_foods.extend()方法添加到总列表中。错误处理:response.raise_for_status():这是一个非常重要的调用,它会在HTTP请求返回非200状态码时(如404 Not Found, 500 Internal Server Error等)抛出HTTPError异常。try-except块:捕获不同类型的requests异常(如HTTPError, ConnectionError, Timeout, RequestException)以及json.JSONDecodeError,增强代码的健壮性。超时设置: 在session.get()中添加timeout参数,防止请求长时间无响应导致程序卡死。数据后处理:获取所有数据后,您可以像原问题中那样,将其转换为pandas.DataFrame进行进一步的清洗、分析和导出。注意处理food_item.get(“description”, “N/A”)等,使用.get()方法可以避免键不存在时抛出KeyError。根据实际需求,可能需要对DataFrame进行填充缺失值(df.fillna())或删除空列(df.dropna())等操作。

5. 总结

通过本文的详细讲解和示例代码,您应该已经掌握了如何有效地处理USDA FDC API的分页问题,从而获取完整的营养数据。核心在于理解API的分页机制,利用pageSize和pageNumber参数,并结合迭代请求和健壮的错误处理机制。这种方法不仅适用于USDA FDC API,也适用于大多数采用分页策略的RESTful API。在实际开发中,始终优先查阅API官方文档,它是解决此类问题的最佳指南。

以上就是深入理解与实现USDA FDC API数据分页获取的详细内容,更多请关注创想鸟其它相关文章!

版权声明:本文内容由互联网用户自发贡献,该文观点仅代表作者本人。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。
如发现本站有涉嫌抄袭侵权/违法违规的内容, 请发送邮件至 chuangxiangniao@163.com 举报,一经查实,本站将立刻删除。
发布者:程序猿,转转请注明出处:https://www.chuangxiangniao.com/p/1369073.html

(0)
打赏 微信扫一扫 微信扫一扫 支付宝扫一扫 支付宝扫一扫
计算图像像素平均亮度时出现不一致问题的解决方案
上一篇 2025年12月14日 09:20:20
掌握USDA食品数据API分页获取完整营养信息教程
下一篇 2025年12月14日 09:20:28

相关推荐

  • java中list的用法 list集合的常用操作方法汇总

    java中的list集合支持多种操作:1.添加元素:使用add方法,默认在末尾添加,也可指定位置。2.删除元素:使用remove方法,需注意删除不存在的元素会抛出异常。3.查找元素:indexof和contains方法,时间复杂度为o(n)。4.排序:使用collections.sort方法,arr…

    2026年8月26日
    000
  • 儿童节礼物-BlueKeep漏洞POC恐怖来袭

    儿童节礼物-BlueKeep漏洞POC恐怖来袭儿童节礼物-BlueKeep漏洞POC恐怖来袭儿童节礼物-BlueKeep漏洞POC恐怖来袭儿童节礼物-BlueKeep漏洞POC恐怖来袭

    0x00:简介 (BlueKeep漏洞的编号为CVE-2019-0708) 据外媒SecurityWeek报道,近百万设备存在BlueKeep高危漏洞的安全风险,并且已有黑客开始扫描寻找潜在的攻击目标。 此漏洞被描述为可蠕虫式传播(wormable),通过RDS服务传播恶意程序,类似于2017年横行…

    2026年8月26日 用户投稿
    000
  • 定时器(Timer)的底层实现

    定时器的底层实现依赖于操作系统的硬件计时器和软件调度机制:1. 硬件层面通过pit或apic等计时器触发中断,管理时间片和任务调度;2. 软件层面通过操作系统api(如linux的timer_create和timer_settime)与内核交互,实现定时器功能。 定时器(Timer)的底层实现到底是…

    2026年8月26日
    000
  • java中抽象类和接口的区别 抽象类与接口的特性对比

    抽象类和接口的主要区别在于设计目的和实现方式:1)抽象类用于定义相关方法,其中部分已实现,适合“is-a”关系;2)接口定义行为,所有方法抽象,适合“can-do”关系。 在Java编程中,抽象类和接口是两个非常重要的概念,它们在实现多态性和代码复用方面发挥了关键作用。那么,抽象类和接口之间到底有什…

    2026年8月26日
    000
  • Bing浏览器国际版大陆能用吗_Bing国际版在国内的访问与使用情况

    Bing国际版可通过https://www.bing.com访问,中国大陆用户可能被重定向至cn.bing.com,建议清除缓存或使用无痕模式并手动切换语言和地区;部分功能受限且搜索结果可能本地化,需稳定网络环境或代理工具以获得完整体验;登录Microsoft账户可同步设置,但无法访问中国大陆屏蔽的…

    2026年8月26日
    100
  • 2K正式发表《NBA 2K26》 9月5日发售

    2k正式发表《nba 2k26》,预定9月5日登陆ps5、ps4、xboxs、xbox one、switch2、switch、pc平台。 Shai Gilgeous-Alexander、Angel Reese、Carmelo Anthony分别担任标准版、WNBA版、超级巨星版封面人物。 以上就是2…

    2026年8月26日
    000
  • java中new一个对象的返回 new操作返回对象引用原理

    new操作符在java中通过四步返回对象引用:1.内存分配:jvm在堆内存中为对象分配空间;2.初始化:jvm对内存进行初始化;3.构造函数调用:jvm调用构造函数;4.返回引用:new操作符返回指向新对象的引用。 在Java中,new操作符用于创建一个新对象,并返回该对象的引用。这是一个看似简单却…

    2026年8月26日
    000
  • Workerman如何与Laravel/Symfony集成?

    Workerman如何与Laravel/Symfony集成?这个问题实际上涉及到如何将一个高性能的PHP WebSocket服务器与现代PHP框架进行无缝集成。让我从这个角度出发,详细展开这方面的讨论。 好的,那么我们就来聊聊如何将Workerman与Laravel或Symfony集成吧。我会从实际…

    2026年8月26日
    100
  • Windows安装WSL2

    Windows安装WSL2Windows安装WSL2Windows安装WSL2Windows安装WSL2

    windows subsystem for linux(简称wsl)是一个在windows 10上能够运行原生linux二进制可执行文件(elf格式)的兼容层。 微软官方安装文档地址: https://docs.microsoft.com/en-us/windows/wsl/install-manu…

    2026年8月26日 用户投稿
    000
  • 抖音直播怎么投屏?如何把手机直播投屏到电视上

    在如今这个信息爆炸的时代,抖音直播已经成为人们生活中不可或缺的一部分。无论是明星、网红还是普通用户,都在抖音上分享自己的生活和才艺。而在观看抖音直播时,很多人都会遇到一个问题:如何将手机屏幕上的直播内容投屏到电视或其他大屏幕上?下面,我就来为大家详细讲解一下抖音直播怎么投屏。 一、投屏方式概述 抖音…

    2026年8月26日
    000
  • java中mapper层的作用 mapper在MyBatis中的功能解析

    在java中,mapper层在mybatis框架中负责将数据库操作映射到java对象上。具体作用包括:1.定义与数据库交互的接口,包含crud操作;2.通过xml文件或注解将sql语句与java方法关联,实现代码与sql的分离;3.支持动态sql,适应复杂查询需求。 让我们从一个简单的问题开始:在J…

    2026年8月26日
    000
  • AI一键操控更便捷 京东携手荣耀发布畅玩70 Plus新品

    AI一键操控更便捷 京东携手荣耀发布畅玩70 Plus新品AI一键操控更便捷 京东携手荣耀发布畅玩70 Plus新品AI一键操控更便捷 京东携手荣耀发布畅玩70 Plus新品AI一键操控更便捷 京东携手荣耀发布畅玩70 Plus新品

    8月8日,京东联合荣耀在北京南苑森林湿地公园举办了一场别开生面的新品发布会,主题为“用心唤起 ai生活”。此次发布的主角是双方共同打造的全新大屏ai手机——荣耀畅玩70 plus 8gb+256gb(以下简称“荣耀畅玩70 plus”)。这款手机不仅在现场吸引了大量周边居民参与体验,还同步在京东平台…

    2026年8月26日 用户投稿
    000
  • 微信公众号怎么设置_微信公众号基础设置与菜单配置教程

    答案:微信公众号设置需完善头像、名称、功能介绍等基础信息,并合理配置自定义菜单。首先完成认证后,应立即设置清晰有辨识度的头像,命名易记且体现定位的账号名称,撰写直击用户痛点的功能介绍,并配置包含感谢语和引导内容的欢迎语;接着在自定义菜单中规划最多三个一级菜单,每个下设不超过五个二级菜单,将核心功能如…

    2026年8月26日
    100
  • 告别阻塞等待:使用Composer和GuzzlePromises玩转PHP异步编程

    最近在开发一个处理用户提交数据的程序时,遇到了一个棘手的问题:用户输入的文本中包含各种非ASCII字符,例如中文、日文、特殊符号等等。这些字符导致程序在处理字符串时效率低下,甚至出现错误。为了解决这个问题,我尝试了多种方法,最终找到了voku/portable-ascii这个库。Composer在线…

    用户投稿 2026年8月26日
    200
  • Windows中Loader Lock引起的死锁问题

    在程序开发中,常见的做法是将程序模块化,通常实现为动态链接库(dll)。在主程序启动时,可以通过隐式或显式的方式加载这些动态链接库。然而,在windows系统中,如果动态链接库的dllmain函数编写不当,可能会导致一些意想不到的bug,例如典型的loader lock死锁问题。这是一个许多wind…

    2026年8月26日
    000
  • 苹果怎么设浏览器默认_iPhone设置默认浏览器应用教程

    从iOS 14起可设第三方浏览器为默认。先确认Chrome、Edge等已支持并更新,再进入设置→浏览器→默认浏览器应用→选择对应浏览器,最后点击链接验证是否生效。 从iOS 14开始,苹果允许用户将第三方浏览器设为默认应用。虽然系统自带Safari仍是初始默认,但你可以轻松更换成Chrome、Edg…

    2026年8月26日
    100
  • PHP如何安全地生成Akamai授权令牌?matricali/akamai-token-auth助你轻松实现内容保护

    最近在开发一个内容分发平台时,我们选择使用Akamai作为CDN服务商,以确保全球用户都能快速、稳定地访问我们的独家视频内容。然而,一个核心的安全需求摆在了我们面前:这些视频必须是付费用户才能观看,并且我们希望对观看权限进行进一步的限制,比如限制在特定IP地址、或者在一定时间内有效。 一开始,我们尝…

    用户投稿 2026年8月26日
    100
  • 依赖注入(DI)容器设计

    依赖注入容器是一种管理和注入对象依赖的工具,提升代码可维护性和灵活性。设计高效di容器需考虑:1. 生命周期管理(单例、瞬时、范围);2. 依赖解析(处理复杂关系图);3. 配置灵活性(支持多种配置方式);4. 性能优化(缓存、延迟加载、并行解析)。 依赖注入(DI)容器是现代软件开发中一个关键的设…

    2026年8月26日
    000
  • java中文乱码怎么解决 中文编码问题的排查与修复

    %ignore_a_1%是由于字符编码不一致导致的。解决方法包括:1. 源代码编码设置为utf-8;2. 编译时使用-encoding参数指定utf-8;3. 运行时设置系统属性file.encoding为utf-8;4. 数据库和web应用编码设置为utf-8。 解决Java中文乱码问题是每个开发…

    2026年8月26日
    100
  • 数智融合为天津高质量发展注入新动能

    7月31日,以“数智世界津门有为”为主题的“华为中国行2025·天津新质生产力城市峰会”在天津成功举办。在峰会期间的媒体沟通会上,华为天津政企业务总经理叶紫阳全面分享了华为在本地的技术落地成果与生态合作进展,深入阐述了如何通过数智化转型驱动区域新质生产力的高质量发展。 多场景落地构建四大行业“天津范…

    2026年8月26日
    100

发表回复

登录后才能评论
关注微信