ダークスーツに白いシャツを着た坪田 一総のプロフェッショナルなポートレート

こんにちは、

坪田 一総

シニアAIプラットフォームエンジニア

クラウドインフラ、AI/ML本番運用、バックエンドエンジニアリング。Kubernetes/EKS上のvLLM推論、マルチモデルサービング、AI Gatewayルーティング、RAGからTool Callingまで本番LLMサービスを設計・運用しています。

  • AWS
  • EKS
  • vLLM
  • Kubernetes
  • Python
日本 · リモート kazusa931209@gmail.com

紹介

本番AIインフラ、LLM推論、GPUベースのモデルサービング、Kubernetes/EKSを専門とする、ソフトウェアエンジニアリング経験7年以上のシニアAIプラットフォームエンジニアです。

vLLMベースの推論インフラ、マルチモデルサービングとルーティング、AI Gateway、オートスケーリング、Terraform、Docker、CI/CDの設計・運用の実務経験があり、推論性能、信頼性、可観測性、セキュリティ、クラウドコスト最適化を重視しています。

LLMサービス、埋め込み、セマンティック検索、pgvector、RAG、LLM Tool Callingなど、AIインフラと本番アプリケーションアーキテクチャを結びつける経験があります。

経歴

  1. ScalyX.ai

    AWS AI Infrastructure / AI Production Engineer

    2025年1月 – 現在

    米国 · リモート

    • テナントごとのEC2からAWS EKS上の共有Kubernetesプラットフォームへ、マルチテナントAIリテール基盤を設計・移行。30以上のテナントを統合し需要ベースのオートスケールを実現、平均月次インフラコストを約17%削減。
    • Kubernetes/EKS上でvLLMベースのGPU推論インフラを設計・最適化。モデル特性、GPU要件、ワークロードパターン、サービング構成を評価し、推論レイテンシ、スループット、可用性、コストのバランスを調整。
    • LLM、音声、ビジョン向けにAI Gatewayとマルチモデルルーティング層を実装。ワークロードとリソース要件に基づくルーティングでGPU関連インフラコストを15%削減しつつ、目標性能を維持。
    • Python/FastAPI、PostgreSQL、Docker、埋め込み、セマンティック検索、pgvector、RAG、LLM Tool Callingを用い本番AIサービスとワークフローを構築。検索、生成、制御されたバックエンドアクションを接続。
    • ALB、ヘルスチェック、HPA、クラスタ/ノードオートスケール、HelmでスケーラブルなKubernetesワークロードを設計。Terraform、Docker、ECR、CI/CDでインフラデプロイを標準化。
    • Prometheus、Grafana、OpenTelemetry、Jaeger、CloudWatchでエンドツーエンド可観測性を構築。インシデント調査時間の平均を50分から30分へ短縮(40%削減)。
    • IAM、VPC/プライベートネットワーク、Security Groups、Kubernetes RBAC、Secrets Manager、テナント単位アクセス制御でAWS/Kubernetesセキュリティとテナント分離を適用。合成負荷試験で最大10K req/secの集約スループットを検証し、レイテンシ、同時実行、GPU使用率を評価。
  2. Madoromi, Inc.

    Infrastructure / Backend Engineer

    2022年1月 – 2024年12月

    東京 · ハイブリッド

    • NestJSモノレポとTurborepoで6つのバックエンドサービスを6台の専用EC2から共有t3.medium環境へ統合。論理サービス境界を維持しつつ本番EC2を83%削減(6→1)、Alpha/MVPトラフィック向け月次EC2コストを約$45から約$30へ(33%削減)。
    • EC2とAurora RDSにまたがるAWS本番インフラを設計・運用。サービスごとの独立キャパシティではなく、観測されたワークロードに合わせてコンピュートとDBをライトサイジング。
    • PostgreSQLと共有ドメイン/API境界を持つモジュラーTypeScript/NestJSバックエンドを確立。フロントエンドエンジニアと機能仕様、API契約、実装要件で協働し、将来のコンテナ化とKubernetes/EKS導入に備えた構成。
    • AWS LambdaとEventBridgeで非本番インフラのスケジューリングを自動化。開発環境の稼働時間を約70%削減(インスタンスあたり週~168時間→~50時間)し、開発時間帯の可用性は維持。
  3. StoreHub

    Full-Stack Engineer

    2018年12月 – 2021年12月

    マレーシア · リモート

    • Next.js、TypeScript、React、Node.js、REST API、PostgreSQLでコマースとPOS機能を構築。クラウドSaaS上で取引、カタログ、在庫、顧客、複数拠点のマーチャントワークフローを支援。
    • 冪等API、Redis Streamsコンシューマグループ、バックグラウンド処理、ビジネスルール検証で、EC、POS、在庫同期、注文処理、通知向けの信頼性の高い分散・非同期システムを設計。
    • テナントスコープのRedisキャッシュとPostgreSQLのクエリ/インデックス/スキーマ最適化で高トラフィックの商品・在庫サービスを最適化。キャッシュヒット率90%超、1,000+通知/秒をp95配信レイテンシ150ms未満で処理。

スキル

AIインフラ・プラットフォーム

LLM推論・GPUインフラ · vLLM · マルチモデルサービング & ルーティング · AI Gateway · 推論最適化 · Kubernetes · EKS · HPA · Helm · クラスタ & ノードオートスケール

AIエンジニアリング

RAG · 埋め込み · セマンティック検索 · PostgreSQL / pgvector · LLM Tool Calling · AIエージェントアーキテクチャ

クラウド・インフラ

AWS · EC2 · EKS · ALB · VPC · RDS / Aurora · S3 · ECR · CloudWatch · IAM · コスト最適化 · ライトサイジング

IaC・DevOps・可観測性

Terraform · Docker · CI/CD · Prometheus · Grafana · OpenTelemetry · Jaeger · メトリクス · ログ · 分散トレーシング

バックエンド・セキュリティ

Python · FastAPI · TypeScript · NestJS · PostgreSQL · Redis Streams · REST API · Kubernetes RBAC · テナント分離 · シークレット管理

学歴

神戸大学

コンピュータ・インテリジェントシステム工学 学士(工学)

2018年

連絡先

シニアAIプラットフォーム、MLインフラ、本番バックエンドエンジニアリングの機会に前向きです。

日本 · リモート