紹介
本番AIインフラ、LLM推論、GPUベースのモデルサービング、Kubernetes/EKSを専門とする、ソフトウェアエンジニアリング経験7年以上のシニアAIプラットフォームエンジニアです。
vLLMベースの推論インフラ、マルチモデルサービングとルーティング、AI Gateway、オートスケーリング、Terraform、Docker、CI/CDの設計・運用の実務経験があり、推論性能、信頼性、可観測性、セキュリティ、クラウドコスト最適化を重視しています。
LLMサービス、埋め込み、セマンティック検索、pgvector、RAG、LLM Tool Callingなど、AIインフラと本番アプリケーションアーキテクチャを結びつける経験があります。
経歴
-
ScalyX.ai
AWS AI Infrastructure / AI Production Engineer
- テナントごとのEC2からAWS EKS上の共有Kubernetesプラットフォームへ、マルチテナントAIリテール基盤を設計・移行。30以上のテナントを統合し需要ベースのオートスケールを実現、平均月次インフラコストを約17%削減。
- Kubernetes/EKS上でvLLMベースのGPU推論インフラを設計・最適化。モデル特性、GPU要件、ワークロードパターン、サービング構成を評価し、推論レイテンシ、スループット、可用性、コストのバランスを調整。
- LLM、音声、ビジョン向けにAI Gatewayとマルチモデルルーティング層を実装。ワークロードとリソース要件に基づくルーティングでGPU関連インフラコストを15%削減しつつ、目標性能を維持。
- Python/FastAPI、PostgreSQL、Docker、埋め込み、セマンティック検索、pgvector、RAG、LLM Tool Callingを用い本番AIサービスとワークフローを構築。検索、生成、制御されたバックエンドアクションを接続。
- ALB、ヘルスチェック、HPA、クラスタ/ノードオートスケール、HelmでスケーラブルなKubernetesワークロードを設計。Terraform、Docker、ECR、CI/CDでインフラデプロイを標準化。
- Prometheus、Grafana、OpenTelemetry、Jaeger、CloudWatchでエンドツーエンド可観測性を構築。インシデント調査時間の平均を50分から30分へ短縮(40%削減)。
- IAM、VPC/プライベートネットワーク、Security Groups、Kubernetes RBAC、Secrets Manager、テナント単位アクセス制御でAWS/Kubernetesセキュリティとテナント分離を適用。合成負荷試験で最大10K req/secの集約スループットを検証し、レイテンシ、同時実行、GPU使用率を評価。
-
Madoromi, Inc.
Infrastructure / Backend Engineer
- NestJSモノレポとTurborepoで6つのバックエンドサービスを6台の専用EC2から共有t3.medium環境へ統合。論理サービス境界を維持しつつ本番EC2を83%削減(6→1)、Alpha/MVPトラフィック向け月次EC2コストを約$45から約$30へ(33%削減)。
- EC2とAurora RDSにまたがるAWS本番インフラを設計・運用。サービスごとの独立キャパシティではなく、観測されたワークロードに合わせてコンピュートとDBをライトサイジング。
- PostgreSQLと共有ドメイン/API境界を持つモジュラーTypeScript/NestJSバックエンドを確立。フロントエンドエンジニアと機能仕様、API契約、実装要件で協働し、将来のコンテナ化とKubernetes/EKS導入に備えた構成。
- AWS LambdaとEventBridgeで非本番インフラのスケジューリングを自動化。開発環境の稼働時間を約70%削減(インスタンスあたり週~168時間→~50時間)し、開発時間帯の可用性は維持。
-
StoreHub
Full-Stack Engineer
- Next.js、TypeScript、React、Node.js、REST API、PostgreSQLでコマースとPOS機能を構築。クラウドSaaS上で取引、カタログ、在庫、顧客、複数拠点のマーチャントワークフローを支援。
- 冪等API、Redis Streamsコンシューマグループ、バックグラウンド処理、ビジネスルール検証で、EC、POS、在庫同期、注文処理、通知向けの信頼性の高い分散・非同期システムを設計。
- テナントスコープのRedisキャッシュとPostgreSQLのクエリ/インデックス/スキーマ最適化で高トラフィックの商品・在庫サービスを最適化。キャッシュヒット率90%超、1,000+通知/秒をp95配信レイテンシ150ms未満で処理。
スキル
AIインフラ・プラットフォーム
LLM推論・GPUインフラ · vLLM · マルチモデルサービング & ルーティング · AI Gateway · 推論最適化 · Kubernetes · EKS · HPA · Helm · クラスタ & ノードオートスケール
AIエンジニアリング
RAG · 埋め込み · セマンティック検索 · PostgreSQL / pgvector · LLM Tool Calling · AIエージェントアーキテクチャ
クラウド・インフラ
AWS · EC2 · EKS · ALB · VPC · RDS / Aurora · S3 · ECR · CloudWatch · IAM · コスト最適化 · ライトサイジング
IaC・DevOps・可観測性
Terraform · Docker · CI/CD · Prometheus · Grafana · OpenTelemetry · Jaeger · メトリクス · ログ · 分散トレーシング
バックエンド・セキュリティ
Python · FastAPI · TypeScript · NestJS · PostgreSQL · Redis Streams · REST API · Kubernetes RBAC · テナント分離 · シークレット管理
学歴
神戸大学
コンピュータ・インテリジェントシステム工学 学士(工学)
2018年
連絡先
シニアAIプラットフォーム、MLインフラ、本番バックエンドエンジニアリングの機会に前向きです。
日本 · リモート
- メール kazusa931209@gmail.com
- LinkedIn linkedin.com/in/kazusa-tsubota
- GitHub github.com/tsubokazu